AI

Claude API RAG 프로젝트 월 비용 실제로 얼마 나올까? 토큰 계산 시뮬레이션

Claude API RAG 프로젝트 월 비용 실제로 얼마 나올까? 토큰 계산 시뮬레이션

RAG 파이프라인 하나 돌리는데 월 얼마 나올까요? “비쌀 것 같다"고 막연하게 생각하다가 청구서 받고 멘붕 오는 팀이 꽤 많아요. 실제로 2026년 현재, Claude API를 프로덕션에서 쓰는 팀들 사이에서 비용 예측 실패가 가장 큰 고민으로 꼽혀요. 실제 RAG 프로젝트 기준으로 월 비용이 어떻게 구성되는지, 어떤 선택이 유리한지 데이터로 뜯어볼게요.

핵심 요약

  • Claude API는 입력/출력 토큰을 별도로 과금하며, RAG 프로젝트에서 컨텍스트 창 크기가 비용을 결정하는 핵심 변수예요.
  • claude-3-5-haiku-20241022 기준 입력 $0.80/MTok, 출력 $4.00/MTok로, 하루 1,000건 RAG 쿼리 시 월 약 $48~$120 수준이에요.
  • Pro 구독($20/월)은 Claude.ai 웹 UI 전용이라 API 프로젝트에는 적용되지 않아요. API는 무조건 종량제예요.
  • claude-3-5-sonnet은 haiku 대비 약 5~8배 비용이 나오지만, 복잡한 추론이 필요한 RAG에서는 정확도 격차가 뚜렷해요.
  • Prompt caching을 적용하면 반복되는 시스템 프롬프트 비용을 최대 90%까지 줄일 수 있어요.

1. Claude API 요금 구조: 뭐가 어떻게 청구되나요?

요금 체계부터 짚고 가야 해요.

Anthropic은 모델별로 입력 토큰과 출력 토큰을 따로 과금해요. 2026년 4월 기준 주요 모델 요금은 이렇게 정리돼요:

모델입력 ($/MTok)출력 ($/MTok)캐시 쓰기캐시 읽기
claude-opus-4$15.00$75.00$18.75$1.50
claude-sonnet-4$3.00$15.00$3.75$0.30
claude-3-5-haiku$0.80$4.00$1.00$0.08

(출처: Anthropic 공식 API 요금 페이지, 2026년 4월)

RAG에서 비용을 키우는 건 입력 토큰이에요. 검색된 문서 조각(chunk)들이 전부 프롬프트에 들어가거든요. 쿼리 하나당 3,0005,000 토큰을 쓰는 게 전형적인 RAG 패턴인데, 여기에 시스템 프롬프트(5001,000 토큰)까지 더하면 입력 비용이 출력보다 훨씬 크게 작용해요.

Pro 구독 얘기가 자주 나오는데, 한 번 정리할게요. claude.com에서 $20/월에 쓰는 Pro 플랜은 웹 인터페이스 전용이에요. API 호출과는 완전히 별개예요. API는 계정 잔액 기반 종량제만 존재하고, 월정액 API 플랜은 없어요.


2. RAG 프로젝트 실제 청구서 시뮬레이션

숫자를 직접 보는 게 빠르죠.

시나리오 A: 내부 문서 QA 봇 (중소 팀)

가정:

  • 하루 요청 수: 500건
  • 쿼리당 평균 입력 토큰: 4,000 (시스템 프롬프트 500 + 검색된 청크 3,000 + 사용자 질문 500)
  • 쿼리당 평균 출력 토큰: 400
  • 모델: claude-3-5-haiku

월간 계산:

  • 입력: 500건 × 30일 × 4,000 토큰 = 60M 토큰 → $48.0
  • 출력: 500건 × 30일 × 400 토큰 = 6M 토큰 → $24.0
  • 월 합계: 약 $72

시나리오 B: 고객 지원 자동화 (중견 SaaS)

가정:

  • 하루 요청 수: 3,000건
  • 쿼리당 평균 입력 토큰: 5,500 (긴 컨텍스트)
  • 출력 토큰: 600
  • 모델: claude-sonnet-4

월간 계산:

  • 입력: 3,000 × 30 × 5,500 = 495M 토큰 → $1,485
  • 출력: 3,000 × 30 × 600 = 54M 토큰 → $810
  • 월 합계: 약 $2,295

이게 Prompt caching 없이 나온 숫자예요. 시스템 프롬프트가 고정값이라면 캐시 적용 후 입력 비용이 $0.30/MTok(읽기 기준)으로 떨어지니까, 실질적으로 월 $800~$900 수준까지 내려갈 수 있어요.

Prompt Caching, 쓰면 얼마나 달라지나요?

시나리오 B에서 시스템 프롬프트 1,000 토큰이 고정이라고 치면:

  • 캐싱 없이: 입력 495M 토큰 × $3.00 = $1,485
  • 캐싱 적용 후 반복 읽기: (3,000건 × 30일 × 1,000 토큰) = 90M → $7.2 / 나머지 405M → $1,215
  • 절약액: 약 $262/월

규모가 커질수록 이 격차는 더 벌어져요.


3. 모델 선택: Haiku vs Sonnet vs Opus, RAG에서 뭐가 맞나요?

비교 기준claude-3-5-haikuclaude-sonnet-4claude-opus-4
월 비용 (시나리오 A 기준)$72$390$1,620
응답 속도매우 빠름보통느림
복잡한 추론낮음높음매우 높음
단순 Q&A RAG✅ 충분✅ 여유❌ 과함
다단계 추론 RAG❌ 부족✅ 적합✅ 적합
장문 문서 요약⚠️ 제한적✅ 적합✅ 우수

“좋은 모델 쓰면 되겠지"는 함정이에요. FAQ 봇이나 단순 문서 검색이면 haiku로 충분하고, 비용은 5~8배 절약돼요. 복잡한 계약서 분석이나 다단계 추론이 필요한 케이스에서만 sonnet을 투입하는 게 맞아요.


4. 실제로 비용 관리하는 방법

문제 1: 청구서가 예상을 넘어서는 경우

RAG에서 청크 사이즈를 크게 잡으면 토큰이 폭발해요. chunk_size=2,000에 top_k=5면 쿼리당 10,000 입력 토큰. top_k를 3으로 줄이고, 청크는 실제 답변에 필요한 단위로 다시 설계하세요.

문제 2: 반복 시스템 프롬프트 비용

고정 지침이 500 토큰 이상이면 Prompt caching 대상이에요. cache_control 파라미터 하나 추가로 반복 호출 비용을 90%까지 줄일 수 있어요. 공식 문서 기준 최소 1,024 토큰 이상부터 캐싱 가능해요.

문제 3: 개발/테스트 환경 비용 통제

prod API 키와 dev API 키를 분리하고, Anthropic 콘솔에서 monthly spend limit을 걸어두세요. 실수로 무한루프 돌리면 청구서가 날아오는 건 순식간이에요.

앞으로 주시할 신호:

  • Anthropic의 배치 처리 API(Message Batches) — 대량 요청 처리 시 절반 할인 제공, 비동기 처리 가능한 파이프라인에서 큰 폭의 절약 가능
  • 모델 가격 변동 — 2024~2025 사이 haiku 가격이 크게 내려온 선례가 있어요. Sonnet 가격도 향후 조정될 가능성 있어요

5. 결론: 청구서, 계획하고 받아야 해요

정리하면 이렇게요:

  • 소규모 RAG (하루 500건 이하): haiku + 캐싱으로 월 $50 이하 관리 가능
  • 중규모 RAG (하루 3,000건 내외): sonnet + 캐싱으로 월 $800~$1,000 예상
  • 대규모 RAG: batch API 적극 써야 수지가 맞아요
  • Pro 구독은 API와 무관 — 팀 내 반드시 공유하세요

6~12개월 뒤를 보면, Anthropic이 개발자 친화적 요금 조정을 이어가고 있어서 haiku급 모델의 성능은 올라가고 가격은 내려가는 흐름이 유지될 것 같아요. Sonnet이 지금의 haiku 포지션을 맡는 날이 오면, RAG 프로젝트 비용 구조 자체가 바뀔 수 있어요.

지금 당장 할 수 있는 행동 하나: 본인 프로젝트의 쿼리당 평균 토큰을 Anthropic 콘솔 로그에서 꺼내서 위 시뮬레이션에 대입해보세요. 예상 청구서가 나올 거예요. 청구서는 받기 전에 계산하는 게 훨씬 덜 아파요.


이 글에서 인용한 API 요금은 Anthropic 공식 가격 페이지(anthropic.com/pricing) 기준이며, 요금은 변경될 수 있어요. 사용 전 최신 공식 페이지 확인을 권장해요.

참고자료

  1. Claude Code Pricing Guide 2026: Every Plan, Real Costs, and How to Choose | LaoZhang AI Blog
  2. Claude Code 요금제 완벽 정리 : Pro 구독 vs API 종량제, 개발자의 선택은?
  3. Plans & Pricing | Claude by Anthropic

Photo by Growtika on Unsplash