테크 경제

AI 자율 에이전트가 내 컴퓨터에서 뭐 하는지 확인하는 법

AI 자율 에이전트가 내 컴퓨터에서 뭐 하는지 확인하는 법

AI가 마우스를 직접 움직이고, 파일을 열고, 버튼을 누르고 있어요. 지금 내 컴퓨터에서요.

2026년 현재, AI 자율 에이전트는 단순한 챗봇을 넘어 실제 PC 환경을 통제하는 단계에 왔어요. OpenAI의 computer-use-preview 모델은 화면을 스크린샷으로 분석하고, click(x, y) 명령으로 정확한 좌표를 클릭하고, 텍스트를 입력해요. 인간이 컴퓨터를 쓰는 방식 그대로요. 그런데 이 에이전트가 정확히 지금 뭘 하고 있는지 파악하는 사람은 많지 않아요.

이게 단순한 불편함이 아니에요. 에이전트가 권한 범위 밖의 파일에 접근하거나, 예상 못한 버튼을 누르거나, 인증이 필요한 서비스에 접속할 때 — 그 순간 투명성이 없으면 감지도, 대응도 불가능해요.

이 글에서는 세 가지를 다뤄요.

  • AI 자율 에이전트가 컴퓨터를 제어하는 기술적 원리
  • 에이전트의 행동을 실시간으로 모니터링하는 방법
  • 플랫폼별 감시·통제 수단 비교

핵심 요약

  • OpenAI의 computer-use-preview 모델은 스크린샷 → 분석 → 클릭/입력 → 재촬영의 4단계 루프로 동작하며, 이 루프 각 단계가 로그로 남길 수 있는 모니터링 접점이에요.
  • Microsoft Copilot Studio의 자율 에이전트 설계 가이드는 감사 로그(Audit Logging)와 최소 권한 원칙을 보안의 핵심 요소로 명시하고 있어요.
  • Windows Agent Launchers는 에이전트를 백그라운드 서비스가 아닌 대화형 환경으로 설계했고, odr.exe로 등록된 에이전트 목록을 직접 조회할 수 있어요.
  • AI 자율 에이전트가 내 컴퓨터에서 뭐 하는지 확인하는 법은 플랫폼마다 다르지만, 공통적으로 세 축(실행 로그, 권한 범위, 이상 감지)으로 접근해야 해요.

AI 자율 에이전트, 어떻게 컴퓨터를 조작하나요?

AI 자율 에이전트가 컴퓨터를 다루는 방식은 생각보다 단순해요. 보는 것 → 판단 → 행동 → 다시 보기. 이 사이클의 반복이에요.

OpenAI의 기술 문서에 따르면, computer-use-preview 모델의 작동 순서는 이렇게 4단계예요.

  1. 스크린샷 캡처 — 현재 화면 상태를 이미지로 수집
  2. UI 요소 분석 — 버튼, 텍스트 필드, 링크 위치 식별
  3. 액션 명령 생성click(832, 241), type("고양이") 같은 구체적 명령 작성
  4. 실행 후 재캡처 — 화면 변화를 확인하고 다음 루프 시작

실제 데모에서는 “고양이 이미지를 찾아줘"라는 단일 명령 하나로 검색창 찾기 → 텍스트 입력 → 엔터키 → 이미지 탭 이동 → 완료 확인까지 다섯 단계를 자동으로 처리했어요. 중간에 인간 개입 제로예요.

실행 환경은 Microsoft의 오픈소스 브라우저 자동화 도구인 Playwright로 샌드박스 처리돼서, AI 행동이 호스트 시스템과 격리돼요. 그런데 여기서 핵심 질문이 나와요 — 샌드박스 안에서 에이전트가 무엇을 했는지, 누가 어떻게 확인하나요?


에이전트가 뭐 하는지 확인하는 세 가지 방법

실행 로그 직접 읽기

가장 직접적인 방법이에요. openai-cua-sample-app을 GitHub에서 내려받아 실행할 때 --debug 플래그를 붙이면, 에이전트가 내리는 모든 판단과 명령이 콘솔에 출력돼요.

python run.py --computer playwright --debug --show

--show 옵션을 함께 쓰면 브라우저 창이 화면에 표시되고, 에이전트가 클릭하는 순간마다 실시간으로 볼 수 있어요. 사실상 에이전트 시점에서 화면을 함께 보는 거예요.

로그에 남는 항목들:

  • 각 루프에서 캡처된 스크린샷 타임스탬프
  • 생성된 액션 명령 전체 (click, type, scroll, key)
  • GPT-5 비전 모델이 분석한 UI 요소 설명
  • 오류 발생 시 에러 메시지와 재시도 횟수

이 로그가 바로 에이전트 행동 파악의 가장 기초예요.


Microsoft 플랫폼의 감사 로그와 권한 제어

Microsoft Copilot Studio 문서는 자율 에이전트 보안 항목에서 네 가지 조치를 명시해요.

  • 최소 권한 원칙: 읽기 전용 에이전트에게 쓰기 권한 미부여
  • 입력 검증: 트리거 이벤트의 진위 여부 실시간 확인
  • 감사 로그: 트리거 발동, 의사결정, 실행 행동을 모두 기록
  • 이상 감지: 무단 데이터 접근 시 즉시 알림

Windows에서는 또 다른 방법이 있어요. Windows Agent Launchers가 제공하는 **ODR(On-Device Registry)**을 통해 현재 시스템에 등록된 모든 에이전트를 조회할 수 있어요.

odr.exe query --type agent

이 명령 하나로 어떤 앱이 어떤 에이전트를 어떤 이름으로 등록했는지 목록이 나와요. 모르는 에이전트가 등록돼 있다면 — 그게 첫 번째 경보 신호예요.


플랫폼별 모니터링 수단 비교

어떤 플랫폼을 쓰느냐에 따라 확인 방법이 달라져요.

기준OpenAI Computer UseMicrosoft Copilot StudioWindows Agent Launchers
로그 방식CLI --debug 출력플랫폼 내 감사 로그ODR 레지스트리 조회
실시간 시각화--show 브라우저 표시대시보드 (관리자 전용)미제공
권한 통제샌드박스(Playwright)역할 기반 접근 제어앱 패키지 매니페스트
이상 감지수동 (로그 직접 확인)자동화 경보 연동 가능미지원
적합 환경개발·테스트 단계기업 워크플로우 배포Windows 앱 개발자
비용입력 $3/백만 토큰기업 라이선스무료 (Windows SDK)

OpenAI는 개발자가 직접 로그를 들여다보는 구조, Microsoft Copilot Studio는 기업 관리자가 대시보드로 보는 구조, Windows Agent Launchers는 등록 여부 자체를 조회하는 구조예요. 목적이 다르죠.


에이전트를 안전하게 두는 세 가지 실천

개발자라면 배포 전 단계에서 반드시 샌드박스 환경에서 --debug 로그를 수집하고, 예상 외 액션이 몇 번 발생하는지 수치화해야 해요. OpenAI 공식 문서도 computer-use-preview를 프로덕션 환경이나 인증이 필요한 작업에 쓰는 건 아직 권장하지 않아요.

기업 IT 담당자라면 Copilot Studio의 감사 로그를 기존 SIEM(보안 정보 및 이벤트 관리) 시스템과 연결하는 게 먼저예요. 에이전트가 비정상적인 시간대에 대용량 데이터를 읽는다면 — 사람이 확인하기 전에 알림이 떠야 하거든요.

개인 사용자라면 odr.exe로 등록된 에이전트 목록을 주기적으로 확인하는 습관이 필요해요. Windows에 설치된 앱들이 몰래 에이전트를 등록할 수 있거든요. 모르는 이름이 보이면 해당 앱을 먼저 검색해보세요.


지금 이 기술을 주시해야 하는 이유

세 가지만 기억해요.

  • 로그가 전부예요: AI 에이전트는 블랙박스가 아니에요. --debug 플래그, 감사 로그, ODR 조회 — 도구는 이미 있어요. 쓰느냐 안 쓰느냐의 차이예요.
  • 권한은 최소로: 에이전트에게 필요 이상의 접근권을 주는 순간, 모니터링으로 대응하기 어려워요. 처음 설계할 때 범위를 좁혀두는 게 나중에 로그 수천 줄 분석하는 것보다 훨씬 낫죠.
  • 플랫폼을 골라서 써야 해요: 개발·실험 단계엔 OpenAI Computer Use, 기업 배포엔 Copilot Studio가 감사 추적 면에서 더 성숙해 있어요.

앞으로 6-12개월 안에 에이전트 행동을 실시간으로 시각화하는 표준 인터페이스가 나올 거예요. Microsoft와 OpenAI 모두 이 방향으로 가고 있고, 규제 압력도 커지고 있어요. 지금 로그를 읽는 습관을 들여두지 않으면, 나중에 규제 감사가 들어왔을 때 제출할 기록이 없는 상황이 생겨요.

AI 에이전트가 내 컴퓨터에서 뭘 하고 있는지 — 그걸 모르는 채로 배포하는 건, 열쇠를 준 채 어디 갔는지 모르는 것과 같아요. 지금 로그를 열어보세요.


Photo by Igor Omilaev on Unsplash