Claude Haiku vs GPT-4o-mini 실제 청구서 비교: 1만 요청 프로덕션 비용 계산법

월말에 API 청구서 받고 눈이 튀어나온 적 있죠? 1만 건 요청이 이렇게 나올 줄 몰랐던 거예요. 2026년 지금, LLM API 비용은 개발 예산의 핵심 변수가 됐는데 — Claude Haiku 3.5와 GPT-4o-mini 중 어느 쪽이 실제로 저렴한지 정확한 숫자로 비교한 글이 생각보다 없더라고요.
이 글에서는 1만 요청 기준 실제 청구서를 뜯어볼 거예요. 단순 가격표가 아니라, 토큰 구성·캐싱·컨텍스트 길이 같은 실제 변수까지 포함해서요.
핵심 요약
- Claude Haiku 3.5 가격(2026년 4월 기준): 입력 $0.80/MTok, 출력 $4.00/MTok. GPT-4o-mini는 입력 $0.15/MTok, 출력 $0.60/MTok. 단순 비교 시 GPT-4o-mini가 약 5배 저렴해요.
- Anthropic 프롬프트 캐싱을 쓰면 반복 입력 토큰 비용이 최대 90% 줄어들어, 긴 시스템 프롬프트 재사용 환경에서는 Haiku 3.5가 역전 가능해요.
- 1만 요청·평균 500 입력/200 출력 토큰 시나리오에서 캐싱 미적용 시 Haiku 3.5가 약 $12.00, GPT-4o-mini가 약 $1.95로 6배 차이가 나요.
- 캐싱 적용(캐시 히트율 85% 가정) 후엔 긴 컨텍스트 시나리오에서 Haiku 3.5 실비용이 $44.00 → $32.36으로 줄어들어 격차가 좁혀져요.
- 단순 비용 최소화엔 GPT-4o-mini, 긴 컨텍스트 반복 작업엔 Haiku 3.5 + 캐싱 조합이 유리해요.
API 가격 경쟁의 배경: 2026년 현재 상황
2024년 하반기부터 OpenAI와 Anthropic은 소형 모델 가격을 연달아 인하했어요. Anthropic은 2024년 11월 Claude 3.5 Haiku를 출시하면서 기존 Claude 3 Haiku 대비 성능은 높이고 가격은 비슷하게 유지했죠. OpenAI는 GPT-4o-mini를 2024년 7월 공개하며 GPT-3.5-turbo보다 저렴한 가격대를 내놨어요.
2026년 현재, 두 모델은 각각 자사 API 생태계의 “실용형 주력 모델” 자리를 차지하고 있어요. 기업들이 고비용 플래그십 모델(Claude Opus, GPT-4o) 대신 소형 모델로 대량 처리 파이프라인을 돌리는 방식을 택하고 있거든요.
Anthropic 공식 가격 페이지와 OpenAI Pricing 페이지(2026년 4월 기준) 현재 가격이에요.
| 항목 | Claude Haiku 3.5 | GPT-4o-mini |
|---|---|---|
| 입력 (per 1M tokens) | $0.80 | $0.15 |
| 출력 (per 1M tokens) | $4.00 | $0.60 |
| 컨텍스트 윈도우 | 200K tokens | 128K tokens |
| 캐싱 지원 | ✅ (최대 90% 절감) | ✅ (제한적) |
| 배치 처리 할인 | ✅ 50% 할인 | ✅ 50% 할인 |
숫자만 보면 GPT-4o-mini가 압도적으로 저렴해요. 그런데 여기서 끝나면 이 글이 필요 없겠죠.
1만 요청 기준 실제 청구서 계산
기본 시나리오: 짧은 Q&A 챗봇
가장 흔한 사용 사례부터 볼게요. 고객 지원 챗봇이나 FAQ 자동화 같은 짧은 대화형 파이프라인이에요.
가정값:
- 요청당 평균 입력: 500 tokens (질문 + 짧은 시스템 프롬프트)
- 요청당 평균 출력: 200 tokens
- 총 요청: 10,000건 / 캐싱 없음
계산하면요.
- 총 입력 토큰: 5,000,000 (5M)
- 총 출력 토큰: 2,000,000 (2M)
Claude Haiku 3.5:
- 입력: 5M × $0.80/M = $4.00
- 출력: 2M × $4.00/M = $8.00
- 합계: $12.00
GPT-4o-mini:
- 입력: 5M × $0.15/M = $0.75
- 출력: 2M × $0.60/M = $1.20
- 합계: $1.95
약 6배 차이예요. 이 시나리오에서는 GPT-4o-mini가 명백히 유리해요.
긴 컨텍스트 시나리오: 문서 분석 파이프라인
실제 프로덕션엔 이보다 복잡한 케이스가 많아요. 긴 시스템 프롬프트, 문서 임베딩, RAG 파이프라인처럼 입력 토큰이 수천 개가 되는 경우요.
가정값:
- 요청당 평균 입력: 3,000 tokens (시스템 프롬프트 2,000 + 사용자 입력 1,000)
- 요청당 평균 출력: 500 tokens
- 총 요청: 10,000건
- Claude 캐싱: 시스템 프롬프트 2,000 tokens, 캐시 히트율 85%
캐싱 미적용 시 기본 비용이에요.
| 항목 | Claude Haiku 3.5 | GPT-4o-mini |
|---|---|---|
| 입력 (30M tokens) | $24.00 | $4.50 |
| 출력 (5M tokens) | $20.00 | $3.00 |
| 합계 | $44.00 | $7.50 |
캐싱 적용 후 Claude Haiku 3.5 계산이에요. Anthropic의 프롬프트 캐싱은 캐시 쓰기(Cache Write)에 $1.00/MTok, 캐시 읽기(Cache Read)에 $0.08/MTok을 부과해요.
- 캐시 히트 토큰: 2,000 × 10,000 × 0.85 = 17M (읽기 요금)
- 캐시 미스 토큰: 2,000 × 10,000 × 0.15 = 3M (쓰기 요금)
- 나머지 입력(사용자 입력): 1,000 × 10,000 = 10M (일반 요금)
비용:
- 캐시 읽기: 17M × $0.08/M = $1.36
- 캐시 쓰기: 3M × $1.00/M = $3.00
- 일반 입력: 10M × $0.80/M = $8.00
- 출력: 5M × $4.00/M = $20.00
- 캐싱 후 합계: $32.36
여전히 GPT-4o-mini($7.50)보다 비싸지만, $44.00이었던 게 $32.36으로 줄었어요. 절감액이 $11.64예요. 시스템 프롬프트가 더 길거나 캐시 히트율이 높아질수록 격차는 더 좁혀져요.
배치 처리까지 더하면?
비실시간 처리가 가능한 파이프라인이라면 양쪽 모두 Batch API를 쓸 수 있어요. 두 모델 모두 배치 요청에 50% 할인을 적용해요(Anthropic Batch API, OpenAI Batch API 공식 문서 기준).
배치 + 캐싱 조합 시 Claude Haiku 3.5의 긴 컨텍스트 시나리오 비용은 약 $16.18까지 내려가요. GPT-4o-mini 배치는 $3.75예요. 배치를 써도 GPT-4o-mini가 저렴하지만, 차이가 좁혀진다는 점은 분명해요.
비용 외 변수: 실제 선택에서 고려할 것들
비용만 보고 결정하면 나중에 후회하는 경우가 생겨요. 실전 변수 세 가지를 짚을게요.
성능 vs 비용 트레이드오프 Claude Haiku 3.5는 Anthropic 내부 벤치마크 기준으로 코딩·추론 태스크에서 GPT-4o-mini를 일부 앞선다고 밝히고 있어요(Anthropic 모델 카드, 2024). 복잡한 지시 따르기나 구조화된 출력이 필요한 작업에서 Haiku 3.5가 더 안정적이라는 평가가 있어요. 비용이 절반이어도 재처리 요청이 두 배라면 의미가 없어요.
컨텍스트 윈도우 크기 Claude Haiku 3.5는 200K 토큰, GPT-4o-mini는 128K 토큰이에요. 긴 문서 분석이나 대화 히스토리를 길게 유지해야 하는 경우, 컨텍스트 한계 때문에 GPT-4o-mini에서 청킹(Chunking) 전략이 따로 필요해질 수 있어요. 이 추가 구현 비용도 고려 대상이에요.
지연 시간(Latency) 두 모델 모두 실시간 응답에 적합하지만, 부하 상태에 따라 응답 속도가 달라져요. 실시간 사용자 응답이 필요한 서비스라면 자체 레이턴시 테스트가 필수예요.
팀 규모별 현실적 선택 기준
스타트업·소규모 팀 (월 예산 민감) GPT-4o-mini가 기본값이에요. 짧은 입력, 빠른 프로토타입, 비용 예측 가능성이 필요한 초기 단계에서는 단순히 더 싸거든요. 복잡한 캐싱 설계보다 빠른 출시가 먼저예요.
중규모 이상 (반복 입력 파이프라인) 시스템 프롬프트가 길고 동일 컨텍스트를 반복 호출하는 구조라면 Haiku 3.5 + 캐싱 조합을 테스트해볼 가치가 있어요. 월 수백만 건 요청 규모에서는 캐싱 절감액이 의미 있는 숫자가 돼요.
어느 쪽을 선택하든 해야 할 것:
- 실제 트래픽으로 A/B 비용 비교 (가정이 아닌 실데이터)
- 캐싱 히트율 모니터링 설정
- 출력 품질 체크 — 재처리 비용까지 포함한 ‘진짜 비용’ 계산
결론: 청구서는 설계에서 결정돼요
단순 가격 비교에서 GPT-4o-mini의 우세는 명확해요. 1만 요청 기준 짧은 입력 시나리오에서 약 6배 저렴하거든요. 그런데 실제 프로덕션 비용은 “어떻게 쓰느냐"가 결정해요.
캐싱, 배치 처리, 컨텍스트 길이, 재처리율을 모두 고려하면 두 모델의 격차는 상황에 따라 크게 달라져요. 지금 당장 비용 시뮬레이션이 필요하다면, 실제 로그에서 평균 입력/출력 토큰을 뽑아 위의 공식에 대입해 보세요. 가정이 아닌 실데이터로 나온 숫자가 예산 결정의 출발점이에요.
여러분 팀의 파이프라인에서 시스템 프롬프트가 얼마나 긴가요? 그 숫자가 모델 선택을 바꿀 수도 있어요.
참고자료
- Claude Code Pricing Guide 2026: Every Plan, Real Costs, and How to Choose | LaoZhang AI Blog
- Claude Code 요금제 완벽 정리 : Pro 구독 vs API 종량제, 개발자의 선택은?
Photo by Levart_Photographer on Unsplash


