AI 자율 에이전트가 내 컴퓨터에서 뭐 하는지 확인하는 법

AI가 마우스를 직접 움직이고, 파일을 열고, 버튼을 누르고 있어요. 지금 내 컴퓨터에서요.
2026년 현재, AI 자율 에이전트는 단순한 챗봇을 넘어 실제 PC 환경을 통제하는 단계에 왔어요. OpenAI의 computer-use-preview 모델은 화면을 스크린샷으로 분석하고, click(x, y) 명령으로 정확한 좌표를 클릭하고, 텍스트를 입력해요. 인간이 컴퓨터를 쓰는 방식 그대로요. 그런데 이 에이전트가 정확히 지금 뭘 하고 있는지 파악하는 사람은 많지 않아요.
이게 단순한 불편함이 아니에요. 에이전트가 권한 범위 밖의 파일에 접근하거나, 예상 못한 버튼을 누르거나, 인증이 필요한 서비스에 접속할 때 — 그 순간 투명성이 없으면 감지도, 대응도 불가능해요.
이 글에서는 세 가지를 다뤄요.
- AI 자율 에이전트가 컴퓨터를 제어하는 기술적 원리
- 에이전트의 행동을 실시간으로 모니터링하는 방법
- 플랫폼별 감시·통제 수단 비교
핵심 요약
- OpenAI의
computer-use-preview모델은 스크린샷 → 분석 → 클릭/입력 → 재촬영의 4단계 루프로 동작하며, 이 루프 각 단계가 로그로 남길 수 있는 모니터링 접점이에요.- Microsoft Copilot Studio의 자율 에이전트 설계 가이드는 감사 로그(Audit Logging)와 최소 권한 원칙을 보안의 핵심 요소로 명시하고 있어요.
- Windows Agent Launchers는 에이전트를 백그라운드 서비스가 아닌 대화형 환경으로 설계했고,
odr.exe로 등록된 에이전트 목록을 직접 조회할 수 있어요.- AI 자율 에이전트가 내 컴퓨터에서 뭐 하는지 확인하는 법은 플랫폼마다 다르지만, 공통적으로 세 축(실행 로그, 권한 범위, 이상 감지)으로 접근해야 해요.
AI 자율 에이전트, 어떻게 컴퓨터를 조작하나요?
AI 자율 에이전트가 컴퓨터를 다루는 방식은 생각보다 단순해요. 보는 것 → 판단 → 행동 → 다시 보기. 이 사이클의 반복이에요.
OpenAI의 기술 문서에 따르면, computer-use-preview 모델의 작동 순서는 이렇게 4단계예요.
- 스크린샷 캡처 — 현재 화면 상태를 이미지로 수집
- UI 요소 분석 — 버튼, 텍스트 필드, 링크 위치 식별
- 액션 명령 생성 —
click(832, 241),type("고양이")같은 구체적 명령 작성 - 실행 후 재캡처 — 화면 변화를 확인하고 다음 루프 시작
실제 데모에서는 “고양이 이미지를 찾아줘"라는 단일 명령 하나로 검색창 찾기 → 텍스트 입력 → 엔터키 → 이미지 탭 이동 → 완료 확인까지 다섯 단계를 자동으로 처리했어요. 중간에 인간 개입 제로예요.
실행 환경은 Microsoft의 오픈소스 브라우저 자동화 도구인 Playwright로 샌드박스 처리돼서, AI 행동이 호스트 시스템과 격리돼요. 그런데 여기서 핵심 질문이 나와요 — 샌드박스 안에서 에이전트가 무엇을 했는지, 누가 어떻게 확인하나요?
에이전트가 뭐 하는지 확인하는 세 가지 방법
실행 로그 직접 읽기
가장 직접적인 방법이에요. openai-cua-sample-app을 GitHub에서 내려받아 실행할 때 --debug 플래그를 붙이면, 에이전트가 내리는 모든 판단과 명령이 콘솔에 출력돼요.
python run.py --computer playwright --debug --show
--show 옵션을 함께 쓰면 브라우저 창이 화면에 표시되고, 에이전트가 클릭하는 순간마다 실시간으로 볼 수 있어요. 사실상 에이전트 시점에서 화면을 함께 보는 거예요.
로그에 남는 항목들:
- 각 루프에서 캡처된 스크린샷 타임스탬프
- 생성된 액션 명령 전체 (
click,type,scroll,key) - GPT-5 비전 모델이 분석한 UI 요소 설명
- 오류 발생 시 에러 메시지와 재시도 횟수
이 로그가 바로 에이전트 행동 파악의 가장 기초예요.
Microsoft 플랫폼의 감사 로그와 권한 제어
Microsoft Copilot Studio 문서는 자율 에이전트 보안 항목에서 네 가지 조치를 명시해요.
- 최소 권한 원칙: 읽기 전용 에이전트에게 쓰기 권한 미부여
- 입력 검증: 트리거 이벤트의 진위 여부 실시간 확인
- 감사 로그: 트리거 발동, 의사결정, 실행 행동을 모두 기록
- 이상 감지: 무단 데이터 접근 시 즉시 알림
Windows에서는 또 다른 방법이 있어요. Windows Agent Launchers가 제공하는 **ODR(On-Device Registry)**을 통해 현재 시스템에 등록된 모든 에이전트를 조회할 수 있어요.
odr.exe query --type agent
이 명령 하나로 어떤 앱이 어떤 에이전트를 어떤 이름으로 등록했는지 목록이 나와요. 모르는 에이전트가 등록돼 있다면 — 그게 첫 번째 경보 신호예요.
플랫폼별 모니터링 수단 비교
어떤 플랫폼을 쓰느냐에 따라 확인 방법이 달라져요.
| 기준 | OpenAI Computer Use | Microsoft Copilot Studio | Windows Agent Launchers |
|---|---|---|---|
| 로그 방식 | CLI --debug 출력 | 플랫폼 내 감사 로그 | ODR 레지스트리 조회 |
| 실시간 시각화 | --show 브라우저 표시 | 대시보드 (관리자 전용) | 미제공 |
| 권한 통제 | 샌드박스(Playwright) | 역할 기반 접근 제어 | 앱 패키지 매니페스트 |
| 이상 감지 | 수동 (로그 직접 확인) | 자동화 경보 연동 가능 | 미지원 |
| 적합 환경 | 개발·테스트 단계 | 기업 워크플로우 배포 | Windows 앱 개발자 |
| 비용 | 입력 $3/백만 토큰 | 기업 라이선스 | 무료 (Windows SDK) |
OpenAI는 개발자가 직접 로그를 들여다보는 구조, Microsoft Copilot Studio는 기업 관리자가 대시보드로 보는 구조, Windows Agent Launchers는 등록 여부 자체를 조회하는 구조예요. 목적이 다르죠.
에이전트를 안전하게 두는 세 가지 실천
개발자라면 배포 전 단계에서 반드시 샌드박스 환경에서 --debug 로그를 수집하고, 예상 외 액션이 몇 번 발생하는지 수치화해야 해요. OpenAI 공식 문서도 computer-use-preview를 프로덕션 환경이나 인증이 필요한 작업에 쓰는 건 아직 권장하지 않아요.
기업 IT 담당자라면 Copilot Studio의 감사 로그를 기존 SIEM(보안 정보 및 이벤트 관리) 시스템과 연결하는 게 먼저예요. 에이전트가 비정상적인 시간대에 대용량 데이터를 읽는다면 — 사람이 확인하기 전에 알림이 떠야 하거든요.
개인 사용자라면 odr.exe로 등록된 에이전트 목록을 주기적으로 확인하는 습관이 필요해요. Windows에 설치된 앱들이 몰래 에이전트를 등록할 수 있거든요. 모르는 이름이 보이면 해당 앱을 먼저 검색해보세요.
지금 이 기술을 주시해야 하는 이유
세 가지만 기억해요.
- 로그가 전부예요: AI 에이전트는 블랙박스가 아니에요.
--debug플래그, 감사 로그, ODR 조회 — 도구는 이미 있어요. 쓰느냐 안 쓰느냐의 차이예요. - 권한은 최소로: 에이전트에게 필요 이상의 접근권을 주는 순간, 모니터링으로 대응하기 어려워요. 처음 설계할 때 범위를 좁혀두는 게 나중에 로그 수천 줄 분석하는 것보다 훨씬 낫죠.
- 플랫폼을 골라서 써야 해요: 개발·실험 단계엔 OpenAI Computer Use, 기업 배포엔 Copilot Studio가 감사 추적 면에서 더 성숙해 있어요.
앞으로 6-12개월 안에 에이전트 행동을 실시간으로 시각화하는 표준 인터페이스가 나올 거예요. Microsoft와 OpenAI 모두 이 방향으로 가고 있고, 규제 압력도 커지고 있어요. 지금 로그를 읽는 습관을 들여두지 않으면, 나중에 규제 감사가 들어왔을 때 제출할 기록이 없는 상황이 생겨요.
AI 에이전트가 내 컴퓨터에서 뭘 하고 있는지 — 그걸 모르는 채로 배포하는 건, 열쇠를 준 채 어디 갔는지 모르는 것과 같아요. 지금 로그를 열어보세요.
Photo by Igor Omilaev on Unsplash


