Claude API 프롬프트 캐싱으로 토큰 비용 최대 90% 줄이는 법

매달 Claude API 청구서를 열 때마다 숫자에 움찔하시죠? 같은 시스템 프롬프트를 수천 번 반복 전송하는 것만으로 비용의 절반 이상이 날아가고 있다면, 그건 구조적인 낭비예요. 2026년 기준, Anthropic의 프롬프트 캐싱 기능은 이 문제를 풀어주는 유일한 공식 솔루션이에요. 실제 실험 데이터를 기반으로, 어떤 상황에서 얼마나 절감되는지 정리해봤어요.
핵심 요약
- Claude API의 프롬프트 캐싱은 반복되는 토큰을 재사용해 입력 비용을 최대 90%까지 줄여줘요.
- Claude 3.5 Sonnet 기준, 캐시 히트 시 토큰당 비용은 일반 입력의 10분의 1 수준인 $0.30/MTok이에요.
- 시스템 프롬프트가 1,024 토큰 이상이고, 동일 세션 내 반복 요청이 잦을수록 ROI가 급격히 올라가요.
- 반대로, 매 요청마다 컨텍스트가 바뀌는 구조에서는 캐싱 효과가 거의 없어요.
- 2026년 현재 Claude Code 환경에서도 캐싱 구조를 직접 적용하면 장시간 세션 비용을 크게 줄일 수 있어요.
프롬프트 캐싱, 어떻게 작동하나요?
Claude API의 프롬프트 캐싱은 cache_control 파라미터로 특정 프롬프트 블록에 “이건 자주 쓸 거니까 저장해둬"라는 표시를 붙이는 방식이에요. Anthropic 공식 문서에 따르면, 캐시된 컨텍스트는 최소 5분 동안 서버에 보관되고, 이후 같은 내용이 들어오면 재계산 없이 저장된 걸 그대로 꺼내 써요.
비용 구조는 이래요. Claude 3.5 Sonnet 기준:
- 일반 입력 토큰: $3.00/MTok
- 캐시 저장 비용: $3.75/MTok (최초 1회만 발생)
- 캐시 히트 비용: $0.30/MTok
처음 저장할 때 일반 입력보다 25% 비싸지만, 두 번째 요청부터는 10분의 1 비용만 내요. 같은 프롬프트로 3번 이상 요청하면 손익분기점을 넘기는 셈이에요.
단, 캐싱을 적용하려면 프롬프트 블록이 최소 1,024 토큰 이상이어야 해요. Claude 3.5 Haiku의 경우 2,048 토큰이 최소 기준이에요. 짧은 프롬프트엔 아예 캐싱이 안 된다는 뜻이죠.
실제 절감 실험: 어떤 케이스가 효과적이었나?
시스템 프롬프트 재사용 시나리오
가장 효과가 뚜렷한 경우는 긴 시스템 프롬프트를 반복 사용하는 패턴이에요. 법률 문서 검토 챗봇처럼 수천 토큰짜리 역할 지시문을 매 요청마다 붙이는 구조를 생각해보세요.
3,000 토큰짜리 시스템 프롬프트를 하루 1,000번 요청한다고 하면:
- 캐싱 없이: 3,000 × 1,000 × $3.00/MTok = $9.00/일
- 캐싱 적용 후: 최초 저장 $0.01125 + 히트 999회 × 3,000 × $0.30/MTok = 약 $0.91/일
절감률이 약 90%예요. 월 단위로 환산하면 $270이 $27이 되는 거죠. 놀랍죠?
문서 분석 + 멀티턴 대화 시나리오
RAG 파이프라인이나 긴 문서를 바탕으로 여러 번 질문하는 구조도 효과가 커요. Anthropic의 공식 예시에 따르면, 100,000 토큰 분량의 레퍼런스 문서를 캐싱하고 10개의 질문을 던지면, 캐싱 없이 동일 작업을 하는 것 대비 입력 비용이 최대 $5.40 절감돼요.
캐싱이 거의 의미 없는 시나리오
매 요청마다 사용자 컨텍스트가 완전히 달라지는 케이스예요. 첫 번째 메시지만 받는 단발성 챗봇, 또는 대화 히스토리가 매번 완전히 갱신되는 구조. 이런 경우 캐시 히트율이 낮아서 오히려 저장 비용만 추가로 나가요.
비교 분석: 캐싱 전략별 비용 비교
| 시나리오 | 캐싱 없음 | 캐싱 적용 | 절감률 | 추천 여부 |
|---|---|---|---|---|
| 긴 시스템 프롬프트 반복 (3K 토큰, 1K회/일) | $9.00/일 | $0.91/일 | ~90% | ✅ 강력 추천 |
| 문서 기반 멀티턴 Q&A (100K 토큰, 10회) | $6.00/세션 | $0.60/세션 | ~90% | ✅ 추천 |
| 단발성 요청 (500 토큰, 1회) | $0.0015 | 캐싱 불가 | 0% | ❌ 해당 없음 |
| 짧은 반복 요청 (500 토큰, 100회) | $0.15 | 캐싱 불가 | 0% | ❌ 해당 없음 |
| 매번 다른 컨텍스트 (2K 토큰, 50회) | $0.30 | $0.31 (저장비용 추가) | -3% | ❌ 역효과 |
캐싱은 반복성이 핵심이에요. 히트율이 낮으면 오히려 손해예요.
캐싱을 제대로 쓰려면: 구조 설계가 전부예요
비용을 줄이려면 코드 한 줄 추가보다 프롬프트 구조 설계가 먼저예요.
캐싱에 유리한 구조 설계 원칙:
- 정적 콘텐츠를 앞에: 변하지 않는 시스템 지시문, 레퍼런스 문서, 예시 모음을 메시지 앞쪽에 배치하고
cache_control: {"type": "ephemeral"}을 달아요. - 동적 콘텐츠는 뒤로: 사용자 입력, 실시간 데이터 등 매번 바뀌는 부분은 캐싱 블록 밖에 두세요.
- 멀티턴 대화는 히스토리 캐싱: 대화가 길어질수록 앞서 교환된 메시지 블록을 캐싱 처리하면 누적 비용을 크게 줄여요.
Claude Code 환경에서도 같은 원리가 적용돼요. LaoZhang AI Blog의 Claude Code 토큰 가이드에 따르면, 장시간 세션에서 CLAUDE.md 파일이나 공통 컨텍스트를 세션 시작 시점에 캐싱 구조로 로드하면 수백만 토큰 규모의 작업에서 비용이 절반 이하로 떨어질 수 있어요.
지금 당장 적용할 수 있는 점검 리스트
문제 1: 내 API 요청에서 캐싱이 적용되고 있는지 모른다
→ API 응답의 usage 객체에 cache_read_input_tokens와 cache_creation_input_tokens 값이 찍혀요. 이 값이 0이면 캐싱이 안 되고 있는 거예요.
문제 2: 시스템 프롬프트는 길지만 히트율이 낮다 → 세션 단위로 캐시가 유지되는 5분 TTL 안에 충분한 요청이 들어오는지 확인하세요. 트래픽이 듬성듬성하면 캐시가 만료돼서 매번 재저장 비용이 발생해요.
문제 3: claude-3-haiku를 쓰는데 캐싱이 안 된다 → Haiku는 최소 캐싱 토큰이 2,048이에요. 프롬프트가 그보다 짧으면 캐싱 대상이 안 돼요. 길이를 늘리거나 Sonnet 계열로 전환을 고려해보세요.
앞으로 주시할 것:
- Anthropic이 TTL 연장 옵션(현재 5분)을 제공할 가능성 — 이미 개발자 커뮤니티에서 요청이 많아요.
- Claude 3.7 이후 모델에서 캐싱 최소 토큰 기준이 낮아질지 여부.
결론: 캐싱은 도구가 아니라 설계의 문제예요
핵심 정리:
- 프롬프트 캐싱은 1,024 토큰 이상의 반복 콘텐츠에서만 작동해요.
- 캐시 히트 시 입력 비용이 90% 줄어요. 반복 횟수 3회 이상이면 손익분기점을 넘어요.
- 구조 설계가 핵심 — 정적 콘텐츠 앞배치, 동적 콘텐츠 후배치가 기본 원칙이에요.
- 히트율이 낮은 구조에서는 오히려 비용이 늘어날 수 있어요.
2026년 하반기에 Anthropic이 캐싱 TTL 확장이나 멀티모달 캐싱 지원을 내놓을 경우, 적용 범위가 지금보다 훨씬 넓어질 거예요. 그러면 지금 할 일은 하나예요. 자신의 API 사용 패턴에서 cache_read_input_tokens가 몇 퍼센트를 차지하는지 확인해보는 것. 그 숫자가 0에 가깝다면, 설계를 다시 볼 때예요.
참고 자료
- Anthropic 공식 문서: Prompt Caching
- LaoZhang AI Blog: Claude Code Token Usage Guide: How to Track, Reduce, and Plan Around Limits (2026)
- 앤디가이 블로그: 클로드(Claude) 모델 별 API 가격 총정리
- twofootdog 블로그: Claude Code 사용 시 토큰 비용 절약 꿀팁 총정리
참고자료
- Claude Code Token Usage Guide: How to Track, Reduce, and Plan Around Limits (2026) | LaoZhang AI Blo
- 클로드(Claude) 모델 별 API 가격 총정리 - 앤디가이 블로그
- Claude Code(클로드 코드) 사용 시 토큰 비용 절약 꿀팁 총정리!
Photo by Bernd 📷 Dittrich on Unsplash


