Claude 토크나이저 비용 실제로 얼마나 나오나: 한국어 토큰 계산과 모델별 단가 비교

API 청구서 받고 예상보다 세 배 넘게 나온 금액에 당황한 적 있나요? Claude API를 처음 붙이는 팀에서 꽤 자주 생기는 일이에요.
Claude API 비용은 “얼마나 오래 썼는가"가 아니라 토큰 수로 결정돼요. 그런데 이 토큰이 생각보다 훨씬 예측하기 어려운 변수거든요. 정확히 계산하려면, 토크나이저가 한국어를 어떻게 쪼개는지부터 이해해야 해요.
실제 API 단가, 모델별 비교, 그리고 비용을 절반 가까이 줄일 수 있는 실전 패턴까지 데이터로 풀어볼게요.
핵심 요약
- Claude 토크나이저는 한국어를 영어보다 더 잘게 쪼개서, 같은 의미의 한국어 문장이 영어보다 30~50% 더 많은 토큰을 소비할 수 있어요.
- 2026년 4월 기준, Claude Opus 4는 입력 $15/1M 토큰·출력 $75/1M 토큰이고, Haiku 3.5는 입력 $0.80/1M·출력 $4/1M으로 약 열아홉 배 차이가 나요.
- System prompt와 대화 맥락이 누적되면, 실제 과금 토큰은 체감 대화량의 두세 배가 될 수 있어요.
- 모델 믹스(Haiku → Sonnet → Opus 단계적 라우팅) 전략으로 같은 품질을 유지하면서 비용을 60~80% 줄인 사례가 Anthropic 공식 블로그에 소개돼 있어요.
토크나이저가 뭔지, 왜 비용이랑 연결되나
Claude는 텍스트를 그대로 처리하는 게 아니에요. 문자를 토큰(token) 단위로 분해한 뒤 그걸 계산하죠. Anthropic은 BPE(Byte Pair Encoding) 기반 토크나이저를 쓰는데, 이 방식은 영어에 최적화된 어휘를 갖고 있어요.
문제는 한국어예요.
영어는 단어 하나가 대체로 12토큰이에요. 반면 한국어는 형태소 구조가 복잡하고, 문자 자체가 BPE 사전에서 더 세분화되는 경향이 있어요. Anthropic 공식 토크나이저 문서와 커뮤니티 실측값을 보면, 한국어는 같은 의미의 영어 대비 **1.31.8배** 더 많은 토큰을 소비해요.
예를 들어 볼게요.
- 영어 “Summarize this document and extract key points.” → 약 9토큰
- 한국어 “이 문서를 요약하고 핵심 포인트를 추출해주세요.” → 약 15~18토큰
거의 두 배죠. 한국어 기반 서비스를 만드는 팀이라면 영어 API 비용 계산표를 그대로 쓰면 안 돼요. 처음부터 한국어 토큰 증가 계수를 반영해야 해요.
2026년 현재 Claude 모델별 비용 구조
Anthropic은 2025년 말 모델 라인업을 대폭 정리했고, 2026년 4월 기준으로 크게 세 계층이 운용되고 있어요.
| 모델 | 입력 (per 1M tokens) | 출력 (per 1M tokens) | 컨텍스트 창 | 특징 |
|---|---|---|---|---|
| Claude Opus 4 | $15 | $75 | 200K | 최고 추론, 복잡한 작업 |
| Claude Sonnet 3.7 | $3 | $15 | 200K | 균형형, 범용 |
| Claude Haiku 3.5 | $0.80 | $4 | 200K | 빠름, 단순 작업 |
출처: Anthropic 공식 API 가격 페이지 (2026년 4월 기준)
Opus와 Haiku 사이에 입력·출력 기준 약 열아홉 배 차이가 있어요. 그런데 실제 청구 금액은 단가만으로 결정되지 않아요. 핵심은 두 가지예요.
1. 출력 토큰이 훨씬 비싸다
모든 모델에서 출력 토큰은 입력의 4~5배예요. 긴 답변을 자주 생성하는 서비스라면 출력 토큰 비용이 전체 청구액의 70% 이상을 차지할 수 있어요.
2. System prompt와 대화 히스토리가 매 요청마다 과금된다
멀티턴 대화를 구현하면 이전 대화 전체가 매번 입력 토큰으로 들어가요. 10번 대화하면 System prompt + 누적 히스토리가 눈덩이처럼 불어나죠. 이걸 모르고 운영하다가 월 청구 금액이 예상의 세 배로 나오는 사례가 실제로 있어요.
실제 비용은 어떻게 계산하나
단순 케이스: 문서 요약 봇
하루 1,000건의 한국어 문서 요약 요청이 들어온다고 가정할게요.
- 평균 입력: 2,000 한국어 토큰 (한국어 계수 적용 시 실제 1,800~2,000)
- 평균 출력: 300 토큰
- 모델: Claude Sonnet 3.7
계산하면 이래요.
- 일별 입력 토큰: 2,000 × 1,000 = 2,000,000
- 일별 출력 토큰: 300 × 1,000 = 300,000
- 일별 비용: (2M × $3/1M) + (0.3M × $15/1M) = $6 + $4.5 = $10.5/일
- 월 비용: 약 $315
같은 조건에서 Opus로 바꾸면 월 $1,575. Haiku로 내리면 월 $43 수준이에요. 선택 하나로 서른다섯 배 차이가 나요.
비용 절감의 핵심: 모델 라우팅
Anthropic 공식 사례에서 가장 많이 언급되는 패턴이 계층적 모델 라우팅이에요.
- 간단한 FAQ, 분류, 짧은 응답 → Haiku 처리
- 중간 복잡도 작업 → Sonnet 처리
- 복잡한 추론, 긴 문서 분석 → Opus 처리
이 방식을 적용하면 전체 요청의 60~70%를 Haiku가 처리하게 되고, 품질을 크게 희생하지 않으면서 비용을 절반 이하로 줄일 수 있어요.
비용 절감 전략 비교
| 비교 항목 | 모델 믹스 전략 | 단일 모델 + 프롬프트 압축 |
|---|---|---|
| 비용 절감 폭 | 60~80% | 20~40% |
| 구현 복잡도 | 높음 (라우팅 로직 필요) | 낮음 |
| 품질 일관성 | 케이스별 다름 | 일정함 |
| 한국어 적합성 | 중간 (Haiku 한국어 품질 주의) | 모델에 따라 다름 |
| 권장 규모 | 월 $500 이상 API 사용 팀 | 소규모 / 빠른 프로토타입 |
단일 모델에서 비용을 줄이는 방법도 있어요. System prompt를 짧게 유지하고, 대화 히스토리를 주기적으로 요약해서 context 길이를 줄이는 거예요. 이것만으로도 같은 요청 수에서 20~30%를 아낄 수 있어요.
그런데 모델 믹스는 한국어 서비스에서 주의가 필요해요. Haiku는 빠르고 저렴하지만, 한국어 뉘앙스 처리나 긴 문맥 이해에서 Sonnet 대비 품질 차이가 느껴질 수 있거든요. 라우팅 기준을 잘못 잡으면 오히려 재처리 비용이 늘어나요.
팀별로 지금 당장 체크해야 할 것
지금 바로 할 수 있는 것:
- Anthropic 콘솔의 Usage 탭에서 일별 입력/출력 토큰 비율 확인
- 전체 입력 중 System prompt 비중 계산 (30% 넘으면 압축 대상)
- 한국어 입력 시 토크나이저 테스트: Anthropic의
tokenize엔드포인트로 실측
3개월 안에 검토할 것:
- 요청 유형을 분류해 Haiku 적용 가능한 케이스 비율 파악
- 월 $200 이상 쓰는 팀이라면 Anthropic의 Batch API 검토 (비동기 처리로 최대 절반 할인)
지켜볼 신호:
- Anthropic이 2026년 하반기 중 한국어 특화 토크나이저 업데이트를 예고한 상태예요. 업데이트 시 한국어 토큰 효율이 개선될 수 있어요.
결론: 비용은 모델이 아니라 설계에서 결정된다
2026년 현재 Claude API 비용의 핵심 변수는 세 가지예요.
- 모델 선택: Haiku vs Sonnet vs Opus, 최대 열아홉 배 차이
- 언어 효율: 한국어는 영어 대비 30~80% 더 많은 토큰 소비
- Context 설계: 누적 대화 히스토리와 System prompt 길이가 실비용을 결정
정직하게 말하면, 단가표보다 두 배 나올 수 있어요. 그리고 그 차이는 대부분 설계 단계에서 만들어지죠.
6~12개월 내 Anthropic의 한국어 토크나이저 개선과 Batch API 확대가 예상되는 만큼, 지금 비용 구조를 제대로 파악해 두는 팀이 다음 스텝에서도 앞설 거예요.
여러분 팀의 월 토큰 청구액에서 System prompt가 차지하는 비중, 한번 직접 측정해봤나요?
참고자료
- Claude - 나무위키
- Plans & Pricing | Claude by Anthropic
- Claude Opus급 성능을 Haiku 가격으로, Advisor Strategy로 AI 비용 90% 절감하는 법 - YouTube
Photo by Planet Volumes on Unsplash


