AI

ChatGPT PDF 긴 문서 제대로 읽는지 확인했을 때 드러나는 구조적 한계

ChatGPT PDF 긴 문서 제대로 읽는지 확인했을 때 드러나는 구조적 한계

100페이지짜리 PDF를 올렸는데, ChatGPT가 자신 있게 틀린 내용을 말하고 있다면? 그게 지금 많은 사람들이 겪고 있는 상황이에요.

PDF 업로드는 이제 일상이 됐어요. 계약서, 리서치 리포트, 기술 문서… 뭐든 올리고 요약을 받죠. 근데 문제는 그 요약이 맞는 건지 틀린 건지 확인할 방법을 모른다는 거예요. AI가 자신 있게 말하면 그냥 믿어버리는 경우가 많거든요.

이 글에서는 ChatGPT가 PDF를 제대로 읽는지 직접 확인해봤을 때 드러나는 구조적 한계와, 실제로 정확도를 높이는 방법을 짚어볼게요.

핵심 요약

  • ChatGPT가 PDF를 못 읽는 건 AI 능력 문제가 아니라 문서 구조 문제다. 스캔 PDF와 텍스트 PDF는 처리 방식이 근본적으로 달라요.
  • 80페이지 전체를 올리는 것보다 12~15페이지만 추출해 올리는 게 정확도 면에서 훨씬 낫다는 게 실제 테스트에서 드러났어요.
  • 표·그래프가 이미지로 삽입된 PDF라면, 텍스트 추출 자체가 안 돼요. 해당 페이지를 PNG로 따로 올려야 해요.
  • AI가 내놓는 숫자·날짜는 초안 수준으로 봐야 하고, 원본과 대조 확인이 필수예요.
  • 도구마다 강점이 달라요. 긴 리포트 비교는 Claude, 혼합 파일 타입은 ChatGPT, 반복 쿼리가 많은 대용량 PDF는 Humata가 낫다는 게 현재 흐름이에요.

PDF를 올린다고 다 같은 게 아니에요

가장 많이 오해하는 부분부터 짚을게요.

PDF에는 두 종류가 있어요.

텍스트 PDF는 Word나 웹에서 내보낸 거예요. 파일 안에 실제 텍스트 데이터가 담겨 있어서 ChatGPT가 바로 읽을 수 있어요. 스캔 PDF는 복사기나 카메라로 찍은 거예요. 페이지가 통째로 이미지라서, AI 입장에선 사진을 보는 것과 같아요.

구분하는 방법은 간단해요. PDF를 열고 텍스트를 드래그해보세요. 글자가 선택되면 텍스트 PDF, 페이지 전체가 하나의 이미지로 잡히면 스캔 PDF예요.

Daily AI Lab의 분석에 따르면, ChatGPT 업로드 실패의 가장 흔한 원인은 파일 수량이 아니라 파일 종류와 업로드 방식이에요. 스캔 PDF는 OCR 처리가 필요한데, OCR도 숫자·기호·표·세로쓰기에서 오류가 꽤 나와요. ‘왜 이상하게 읽지?‘라는 질문의 답은 대부분 이 지점에 있는 셈이에요.

파일명도 의외로 중요해요. 보고서(최종)v2.pdf 같은 한글+특수문자 파일명은 업로드 자체가 실패하는 경우가 생겨요. report_v2.pdf처럼 영문+숫자로만 바꾸면 해결되는 경우가 많고요.


긴 문서를 통째로 올리면 생기는 일

80페이지짜리 시장조사 보고서를 전체 올린다고 가정해볼게요. ChatGPT가 전부 읽을 것 같지만, 실제로는 맥락 처리 용량(context window) 안에서 우선순위를 정해요. 앞부분과 뒷부분이 상대적으로 잘 기억되고, 중간이 흐릿해지는 경향이 있어요.

readingnoteandstudy.tistory.com의 분석에 따르면, 긴 문서에서 AI 오독 증상은 꽤 구체적으로 나타나요.

  • 단락 순서가 뒤집혀서 요약됨
  • 표의 행·열이 섞임
  • 각주 내용이 본문에 섞여 들어옴
  • 그래프 데이터가 아예 빠지거나 틀린 값으로 채워짐

이게 AI가 멍청해서가 아니에요. PDF의 다단 레이아웃, 복잡한 표, 이미지로 삽입된 차트가 텍스트 추출 과정에서 순서를 망가뜨리는 거예요.

그럼 어떻게 해야 할까요? 답은 쪼개기예요. 80페이지 중 필요한 12~15페이지만 추출해서 올리는 거예요. Chrome이나 Edge에서 인쇄 → PDF로 저장 → 페이지 범위 지정으로 바로 할 수 있어요. Mac이라면 Preview에서 사이드바 페이지를 선택해 드래그하면 새 파일로 분리돼요.


ChatGPT vs Claude vs Humata: 뭘 써야 할까

직접 확인해봤을 때 드러나는 건, 도구마다 강점이 다르다는 점이에요.

도구가장 잘 맞는 상황약점
ChatGPTPDF + Excel + 이미지 혼합 파일스캔 PDF 처리, 플랜별 기능 차이
Claude긴 리포트 비교·재작성사용량 한도에 따라 대용량 제한
Perplexity파일 + 실시간 웹 검색 병행단독 문서 심층 분석엔 부족
Humata대용량 PDF 반복 쿼리범용성이 낮음

praymeyer2025.tistory.com의 도구 비교에 따르면, 현재 파일 분석의 핵심 가치는 단일 문서 요약에서 여러 문서 동시 비교로 넘어가고 있어요. 시장 리포트 + 경쟁사 데이터 + 회의록 + 비용 엑셀을 한 번에 올려서 교차 분석하는 방식이죠.

단, 같은 파일명을 가진 문서가 여러 개면 AI가 혼동해요. 파일명을 market_Q2.pdf, competitor_Q2.pdf처럼 명확하게 구분해주는 게 좋아요. 그리고 고객 정보, 계약서, 내부 전략 문서는 업로드 전에 조직 보안 정책을 반드시 확인해야 해요. 타협 없이 지켜야 할 부분이에요.


실제로 정확도를 높이는 4가지 방법

이론은 충분히 봤으니, 실전으로 가볼게요.

1. 특정 페이지를 명시해서 물어보기 “12~15페이지의 표에서 2025년 매출 수치만 뽑아줘"처럼 범위를 정확히 주는 거예요. 막연하게 “이 보고서 요약해줘"보다 정확도가 훨씬 올라가요.

2. 출처 페이지 요청하기 답변에 “어느 페이지 내용인지 원문 문장과 함께 알려줘"를 붙이는 거예요. AI가 페이지 번호를 제시하더라도 직접 확인은 필수예요. 확인을 빠르게 해주는 장치인 셈이에요.

3. 이미지로 삽입된 표·그래프는 따로 올리기 텍스트 추출로는 이미지 표가 완전히 빠져요. 해당 페이지를 PNG나 JPG로 캡처해서 PDF와 함께 올리면 처리돼요.

4. 파일 10개 이상이면 배치 전략 쓰기 한 번에 2~3개씩 올리고 각 배치에서 요약을 뽑아요. 그 요약 텍스트를 새 대화에 붙여넣고 교차 분석을 시키는 거예요. 파일 업로드 한도를 우회하면서 맥락도 깔끔하게 유지되는 방법이에요.


지금 당장 확인해야 할 것

결론은 하나예요. AI는 어디를 확인해야 하는지 빠르게 찾아주는 도구예요. 최종 검증을 대신하는 도구가 아니라는 거죠.

지금 당장 해볼 수 있는 건 간단해요. 최근에 ChatGPT로 요약한 PDF를 하나 꺼내서, 그 안의 숫자 세 개만 원본과 대조해보세요. 일치한다면 다행이에요. 하나라도 다르다면, 지금 쓰는 방식을 바꿀 때가 됐어요.

앞으로 6~12개월 사이에 AI의 PDF 처리 정확도는 분명 올라갈 거예요. 특히 이미지 내 표 인식, 다단 레이아웃 처리가 개선되는 방향으로요. 그런데 그때도 마찬가지예요. 숫자가 들어간 문서는 반드시 원본과 대조해야 해요. 도구가 좋아질수록, 오히려 방심하기가 더 쉬워지거든요.

지금 쓰는 PDF 중에 AI가 틀리게 읽었을 가능성이 있는 문서가 몇 개나 될까요?

참고자료

  1. I gave ChatGPT, Claude, and NotebookLM the same 100-page PDF — here’s who actually understood it
  2. ChatGPT/사용법 - 나무위키

Photo by Levart_Photographer on Unsplash