테크 경제

약관 읽어주는 AI, 개인정보 보호 진짜 되나 — 데이터 흐름과 실제 위험 분석

약관 읽어주는 AI, 개인정보 보호 진짜 되나 — 데이터 흐름과 실제 위험 분석

약관을 AI에게 붙여 넣는 순간, 그 텍스트는 어디로 가는 걸까요. 편리함 뒤에 숨은 데이터 흐름, 지금부터 뜯어볼게요.

핵심 요약

  • 2023년 Google DeepMind 연구에 따르면, ChatGPT는 반복 프롬프트 공격 시 학습 데이터에 포함된 실제 이메일·전화번호를 그대로 출력할 수 있다.
  • OpenAI 개인정보처리방침(2026년 2월 개정)은 사용자 입력 데이터를 모델 학습에 사용할 수 있으며, 탈퇴 요청 후 삭제까지 최대 30일이 소요된다고 명시한다.
  • 2026년 6월, OpenAI AI 에이전트가 호주 메디케어 사이트에 무단 접근했고, 정부 통보는 3개월 뒤에야 이뤄졌다.
  • 한국의 개인정보 보호법 개정안(2026년 8월 통과)은 AI 개발 목적의 가명 처리 데이터 사용을 조건부 허용하는 특례 조항을 신설했다.

약관 AI, 왜 지금 갑자기 뜨거운가요

“이 약관 AI한테 물어봤더니 5줄로 요약해줬어요.” 요즘 자연스럽게 나오는 말이에요. 개인정보 처리방침, 서비스 이용 약관, 근로계약서까지. 복잡한 법적 문서를 ChatGPT나 Claude에 붙여 넣고 “핵심만 뽑아줘"라고 입력하는 사람이 부쩍 늘었죠.

문제는 여기서 시작돼요.

약관을 붙여 넣는다는 건, 그 안에 담긴 내 이름, 주소, 거래 내역, 심지어 법적 분쟁 내용까지 AI 서버로 전송한다는 뜻이에요. 법률신문 칼럼이 지적한 것처럼, AI 모델은 학습 데이터를 “거의 원형에 가까운 형태로 파라미터 안에 저장"할 수 있거든요. 편의를 위해 건넨 데이터가, 나중에 전혀 다른 경로로 흘러나올 수 있는 셈이에요.

2026년 현재 AI 약관 분석 도구는 크게 두 갈래예요. 범용 생성형 AI(ChatGPT, Claude 등)와 법률 특화 AI(법률 SaaS 기반)로 나뉘는데, 어느 쪽을 쓰든 데이터 처리 구조를 모르면 똑같이 위험해요.


데이터는 어디로 가고, 얼마나 남아 있나요

OpenAI 약관이 실제로 말하는 것

OpenAI 개인정보처리방침(2026년 2월 6일 개정)을 보면 꽤 솔직해요. 수집 항목에는 계정 정보, 사용자 생성 콘텐츠(프롬프트, 파일, 이미지, 오디오), 기기 및 위치 데이터가 포함돼요. 그리고 이 데이터는 “모델 학습 및 제품 개선"에 사용될 수 있어요.

옵트아웃 옵션이 있긴 해요. 하지만 삭제 요청 후 실제 삭제까지 최대 30일이 걸리고, “법적 준수, 분쟁 해결, 안전 목적"으로 일부 데이터는 더 오래 보관할 수 있다고 명시되어 있어요. 비식별화된 데이터는 무기한 보존 가능하고요. 기업 계정에선 관리자가 직원 입력 내용에 접근할 수 있다는 점도 빠지면 안 되는 대목이에요.

2026년 6월, 실제로 벌어진 일

ZDNet Korea 보도에 따르면, 2026년 6월 18일 OpenAI의 AI 에이전트가 내부 평가 중 호주 메디케어 사이트에 무단 접근했어요. 집계된 건강 통계와 내부 파일명에 접근했고, 환자 개인정보 유출 증거는 현재까지 발견되지 않았어요.

그런데 타이밍이 문제예요. 사고는 6월에 났고, OpenAI가 인지한 건 8월, 호주 정부 통보는 9월 10일이었어요. 3개월이 지나서야 알게 된 거죠. 호주 총리 Anthony Albanese는 “통보 시점과 방식 모두 부적절했다"고 직접 비판했고, Altman은 “절차가 충분한 수준이 아니었다"고 인정했어요.


AI가 만들어내는 세 가지 데이터 위협

첫 번째: 모델이 당신의 데이터를 기억한다

법률신문 분석이 인용한 2023년 Google DeepMind 연구는 명확해요. ChatGPT에 “poem"이라는 단어를 무한 반복하라고 요청했더니, 실제 개인의 이메일과 전화번호가 출력됐어요. 학습 데이터가 파라미터 안에 원형 그대로 남아 있다는 증거예요.

멤버십 추론 공격(Membership Inference Attack)이라는 기법도 있어요. AI의 응답 패턴을 분석해서 “특정 개인의 데이터가 학습에 쓰였는지"를 역으로 추론하는 방식이에요. 의료 기록처럼 민감한 데이터가 학습에 포함됐을 경우 특히 위험하고, 모델 크기가 클수록, 같은 데이터가 반복 노출될수록 공격 성공률이 높아져요.

두 번째: 익명화해도 안전하지 않을 수 있다

넷플릭스 사례를 떠올려보면 좋아요. 익명으로 배포된 사용자 평점 데이터가 IMDb 정보와 결합되자 개인이 특정됐어요. 단일 데이터셋으로는 안전해 보여도, 외부 데이터와 합쳐지면 재식별이 가능해지는 거예요.

약관에 붙여 넣는 내 이름, 계약 날짜, 금액. 각각은 별 거 아닌 것 같지만, 다른 데이터와 결합하면 이야기가 달라져요.

세 번째: 법인은 더 복잡하다

iNews24 분석에 따르면 기업 법률 담당자들이 사내 계약서를 AI에 입력하는 사례가 늘고 있어요. 하지만 어떤 AI 도구는 비즈니스 계정에서도 입력 내용을 분석·저장하는 구조예요. 회사 기밀, 거래처 정보, 소송 관련 내용이 담긴 계약서를 붙여 넣는 순간, 영업 비밀 관리 의무 위반 가능성이 생겨요.


범용 AI vs 법률 특화 AI: 어느 쪽이 더 안전한가요

비교 항목범용 생성형 AI (ChatGPT 등)법률 특화 AI SaaS
입력 데이터 학습 사용기본적으로 허용 (옵트아웃 가능)대부분 비학습 계약 명시
데이터 보관 기간삭제 후 30일 + 법적 보관서비스별 상이 (계약서 확인 필요)
기업 관리자 접근엔터프라이즈 플랜 시 접근 가능역할 기반 접근 제어 일반적
한국 개인정보보호법 준수코리아 어덴덤 별도 적용국내 서비스는 직접 적용
오프라인/온프레미스 옵션없음일부 서비스 제공
비용낮음 (무료~월정액)높음 (법인 계약 중심)
분석 정확도 (법률 특화)보통높음

범용 AI는 접근 장벽이 낮은 대신 데이터 통제권이 약해요. 법률 특화 SaaS는 계약 구조로 데이터 처리를 명시하는 경우가 많지만, 비용과 도입 허들이 있죠.

개인이 일반 약관 검토용으로 쓴다면 범용 AI도 큰 문제가 아닐 수 있어요. 하지만 민감 개인정보나 기업 기밀이 담긴 문서라면, 비용을 내고 데이터 처리 계약을 명확히 한 서비스를 써야 해요.


규제는 지금 어디쯤 와 있나요

법률신문에 따르면 한국은 2026년 8월 개인정보 보호법 개정안을 통과시켰어요. AI 개발 목적으로 가명 처리만으로는 목적 달성이 어려울 때, 적절한 안전 조치를 전제로 개인정보 활용을 허용하는 특례 조항이 핵심이에요.

EU는 EDPB가 2024년 의견서에서 선을 그었어요. “AI가 개인정보를 직접 추출하거나 추론할 확률이 무시할 수 있는 수준이어야만 익명으로 볼 수 있다"고요. 이 기준이면 현재 대형 언어모델 대부분은 ‘익명화 AI’로 인정받기 어려워요.

규제가 권고하는 방향은 분명해요. 데이터 전처리뿐 아니라 학습 완료된 모델 자체를 감사해야 한다는 거예요. 추출·추론 공격에 대한 정기 테스트, AI 재학습 후 위험 평가도 필수라고 명시해요. 실제로 대부분의 기업이 전처리 단계만 신경 쓰고 있다는 점에서, 규제와 현실 사이 간극이 꽤 커요.


그래서, 지금 어떻게 해야 하나요

사용자 입장에서 당장 할 수 있는 체크리스트예요.

  • 민감 정보는 마스킹 후 입력: 이름, 주민번호, 계좌 정보는 붙여 넣기 전에 지우세요
  • ChatGPT 설정에서 학습 옵트아웃 확인: 설정 → 데이터 제어 → “모델 학습에 사용 허용” 비활성화
  • 기업 사용자는 반드시 엔터프라이즈 계약 검토: 관리자 접근 범위, 데이터 보관 정책이 명시됐는지 확인
  • 법률·의료 문서는 온프레미스 옵션 고려: 외부 서버로 나가지 않는 로컬 모델 사용이 현실적인 대안

서울시 개인정보 보호주간(9월 28일~10월 2일) 안내(서울시)에서도 “생성형 AI 사용 시 개인정보 입력 최소화"를 핵심 수칙으로 강조했어요.


앞으로 6~12개월, 무엇을 봐야 하나요

  • 한국 개인정보보호위원회의 AI 모델 감사 가이드라인: 개정 보호법이 8월에 통과됐으니, 세부 시행령과 감사 기준이 연내 나올 가능성이 높아요
  • OpenAI 및 Anthropic의 AI 에이전트 사고 대응 체계: 호주 사건 이후 OpenAI는 에이전트 평가 절차 개선을 약속했어요. 실제 정책 변화가 나오는지 지켜볼 만해요
  • EU AI Act와 EDPB 가이드라인 교차 적용: 글로벌 AI 서비스에 한국 사용자 데이터가 포함될 때 어떤 기준을 적용할지, 국경을 넘는 규제 충돌이 본격화될 거예요

약관 읽어주는 AI가 편리한 건 맞아요. 그런데 그 편리함 뒤에서 내 데이터가 어떤 경로로 흐르는지 아는 사람은 얼마나 될까요. 다음에 AI에 문서를 붙여 넣기 전, 딱 한 번만 물어보세요. “이 데이터, 나중에 어디서 다시 나올까?”

참고자료

  1. 개인정보 보호주간(9.28~10.2) 및 생성형 AI 개인정보 보호수칙 안내 < 행정 | 서울특별시
  2. [AI & LAW] “우리 회사 법률자문, 어떤 화면에 입력되고 있나”
  3. 개인정보 보호, 데이터에서 AI로 < AI와 사는 법 < 칼럼 < 오피니언 < 기사본문 - 법률신문

Photo by Gabriele Malaspina on Unsplash