AI

MCP 토큰 비용 문제: AI 에이전트 실제 청구 금액이 예상보다 높은 이유

MCP 토큰 비용 문제: AI 에이전트 실제 청구 금액이 예상보다 높은 이유

MCP를 프로덕션에 올린 첫 달, 청구서가 예상의 네 배로 나왔어요. 실제로 2026년 들어 MCP(Model Context Protocol)를 쓰는 개발팀에서 반복되는 일이에요.

MCP는 AI 에이전트가 외부 도구와 데이터를 다루는 방식을 표준화했어요. 덕분에 통합이 편해졌죠. 그런데 그 편리함 뒤에 숨어 있는 건 생각보다 훨씬 무거운 토큰 소비예요. “쿼리 한 번에 얼마” 계산으로는 MCP 토큰 비용을 전혀 잡을 수 없어요.

이 글에서 다룰 핵심은 네 가지예요.

  • MCP가 일반 API 호출보다 토큰을 더 많이 쓰는 이유
  • AI 에이전트 실제 청구 금액이 어디서 터지는지
  • 비용 구조 직접 비교
  • 지금 당장 할 수 있는 실질적인 대응법

핵심 요약

  • MCP는 매 호출마다 도구 스키마 전체를 컨텍스트에 주입해요. 도구가 10개면 단순 스킬 방식 대비 토큰 소비가 두 배 이상 늘어나는 패턴이 관찰돼요.
  • AI 에이전트 실제 청구 금액은 단일 쿼리 비용이 아니라 “루프당 누적 컨텍스트"로 결정돼요. 이를 모르고 설계하면 5~10스텝짜리 작업에서 비용이 선형이 아닌 지수적으로 불어나요.
  • 2026년 2월 기준 Claude 3.5 Sonnet 입력 토큰은 $3/1M, GPT-4o는 $2.5/1M이지만, MCP 오버헤드를 포함하면 실효 단가는 공시 가격의 1.5~3배 수준이에요.
  • 비용 폭증의 주범은 도구 목록 반복 주입과 멀티스텝 루프에서의 대화 전체 누적이에요.
  • 컨텍스트 윈도우 관리와 도구 필터링만으로도 MCP 토큰 비용을 30~50% 줄일 수 있어요.

MCP가 토큰을 이렇게 많이 쓰는 이유

도구 스키마가 매번 컨텍스트에 들어가요

에이전트가 도구를 호출하려면 모델이 “어떤 도구가 있는지, 어떻게 쓰는지"를 먼저 알아야 해요. 그래서 MCP는 매 요청마다 등록된 도구의 JSON 스키마 전체를 프롬프트 앞부분에 넣어요.

도구 하나의 스키마가 대략 200400 토큰이에요. 도구 다섯 개면 최소 1,0002,000 토큰이 그냥 날아가는 거예요. 쿼리 자체가 50 토큰짜리 간단한 질문이어도요.

brunch.co.kr의 MCP 토큰 분석 글(2025)에서는 이걸 “스킬 방식(Skills)과의 결정적 차이"로 설명해요. 스킬 방식은 모델이 파인튜닝된 동작을 그냥 호출하니까 스키마 주입이 없어요. 반면 MCP는 범용 표준이라서 모델이 런타임에 도구 구조를 매번 읽어야 해요. 유연성을 얻은 대신 토큰을 내는 구조예요.

멀티스텝 에이전트에서 비용이 지수적으로 늘어요

단일 질문이라면 오버헤드가 크지 않아요. 문제는 에이전트가 여러 단계를 거칠 때 발생해요.

에이전트가 다섯 번 도구를 부르는 작업을 한다고 가정해볼게요. 많은 MCP 구현체에서 이전 대화 히스토리 전체가 매 스텝마다 컨텍스트에 누적돼요. 1스텝 때 1,500 토큰이었던 게 5스텝 때는 8,000~12,000 토큰이 되는 거예요. 도구 스키마 반복 + 이전 결과 누적이 동시에 일어나니까요.

“웹 검색 → 데이터 파싱 → 요약 → 이메일 초안 작성” 네 단계 작업에서, 각 단계별 토큰을 모두 더하면 단순 계산의 세 배가 넘는 경우가 흔해요.


실제 청구서 어디서 터지나: 비용 구조 해부

공시 가격 vs 실효 단가 차이

2026년 2월 기준 주요 모델의 입력 토큰 단가예요.

모델공시 입력 단가 ($/1M)MCP 오버헤드 포함 실효 단가 추정주요 특징
Claude 3.5 Sonnet$3.00$4.50~$7.00긴 컨텍스트 처리 강점
GPT-4o$2.50$3.75~$6.00도구 호출 안정성
Gemini 1.5 Pro$1.25$2.00~$4.00100만 토큰 윈도우
Llama 3.3 (자체 호스팅)$0.00~$0.20$0.30~$1.00인프라 비용 별도

※ 실효 단가는 도구 5개, 평균 4스텝 기준 추정치. 각 회사 공식 가격 페이지 기준 공시 단가, 오버헤드 배율은 MCP 구조 특성에서 도출.

실효 단가가 공시 가격보다 1.5~3배 높다는 게 핵심이에요. Claude 3.5 Sonnet을 썼더니 예상보다 두 배 나왔다는 팀들의 이야기가 나오는 이유가 바로 이거예요.

비용 폭증 패턴 세 가지

1. 전체 도구 목록 무조건 주입 에이전트에 도구를 30개 등록해뒀는데 실제 작업에서 3개만 필요한 경우예요. 나머지 27개 스키마도 전부 컨텍스트에 들어가요. 그냥 버리는 토큰이에요.

2. 히스토리 무제한 누적 에이전트 프레임워크 설정에서 max_historycontext_window 관리를 안 하면 대화가 길어질수록 비용이 눈덩이처럼 불어나요.

3. 오류 재시도 루프 도구 호출이 실패했을 때 에이전트가 자동 재시도하면서 동일한 컨텍스트를 여러 번 보내는 패턴이에요. 실패 한 번이 성공한 케이스보다 더 비싼 역설이 생기죠.


MCP 토큰 비용 대응: 접근법 비교

MCP vs 스킬 방식 vs 파인튜닝: 뭐가 유리한가

MCP (범용 도구 표준):

  • 장점: 도구 추가/변경이 쉽고, 모델 교체 시 재작업 최소화
  • 단점: 도구 수와 스텝 수에 따라 토큰 비용이 급격히 오름
  • 적합한 경우: 도구가 자주 바뀌거나, 다양한 모델을 섞어 쓰는 환경

스킬/함수 호출 방식 (Function Calling):

  • 장점: 스키마 오버헤드 없음, 특정 작업에서 토큰 절반 이상 절약 가능
  • 단점: 도구 변경마다 프롬프트 또는 파인튜닝 수정 필요
  • 적합한 경우: 도구 세트가 고정적이고 반복 작업 비중이 높은 경우

자체 파인튜닝:

  • 장점: 런타임 스키마 주입 불필요, 장기적으로 가장 저렴
  • 단점: 초기 비용(데이터 수집, 학습)이 크고, 도구 업데이트 반영이 느림
  • 적합한 경우: 동일 패턴이 하루 수천 번 반복되는 프로덕션 환경

MCP 토큰 비용 문제는 “MCP가 나쁜 방식"이라는 게 아니에요. 용도를 잘못 맞춘 게 문제인 경우가 더 많아요. 도구가 계속 바뀌고 프로토타이핑 단계라면 MCP가 맞고, 반복 작업이 확정됐다면 Function Calling이나 파인튜닝으로 전환하는 게 낫죠.


실무 대응: 지금 바로 할 수 있는 것들

개발자·엔지니어라면

단기 (지금~3개월 내):

  • 도구 동적 필터링 구현: 요청 유형에 따라 필요한 도구 스키마만 주입하도록 라우팅 레이어를 넣어요. 도구 10개 중 3개만 주입하면 스키마 오버헤드가 70% 줄어요.
  • 컨텍스트 윈도우 하드캡 설정: max_history_tokens를 4,000~6,000 수준으로 강제하고, 오래된 스텝은 요약본으로 압축해요.
  • 비용 모니터링 대시보드: 요청당 토큰 수를 로깅하고 스텝별 소비 패턴을 추적해요. 어느 도구 호출이 가장 비싼지 보이면 최적화 우선순위가 명확해져요.

중기 (3~12개월):

  • 반복 패턴이 굳혀진 워크플로는 Function Calling 또는 경량 파인튜닝으로 마이그레이션 검토
  • Gemini 1.5 Pro 같은 긴 컨텍스트 모델은 토큰 단가가 낮아서 MCP 오버헤드 흡수력이 상대적으로 좋아요. 모델 조합 전략을 써볼 수 있어요.

기업·팀 단위라면

AI 에이전트 실제 청구 금액을 예산에 반영할 때 공시 단가 기준으로 잡으면 반드시 초과 지출이 나와요. CIO.com의 AX 트렌드 리포트(2025)에서도 기업 AI 비용의 예측 불가능성을 주요 리스크로 꼽았어요. 최소한 공시 단가의 두 배를 버퍼로 잡고 시작하는 게 현실적이에요.


앞으로 6~12개월, 뭘 봐야 할까

MCP 토큰 비용 문제는 구조적인 문제라 쉽게 사라지지 않아요. 다만 세 가지 방향에서 변화가 올 거예요.

모델 사이드의 캐싱 발전. Anthropic과 OpenAI 모두 프롬프트 캐싱 기능을 강화하고 있어요. 반복 주입되는 도구 스키마를 캐싱하면 실효 비용이 30~40% 낮아질 수 있어요. 2026년 하반기에는 더 정교해질 가능성이 높아요.

MCP 스펙 자체의 최적화. Anthropic이 주도하는 MCP 커뮤니티에서 “스키마 압축”, “선택적 도구 노출” 같은 제안들이 올라오고 있어요. 표준 레벨에서 오버헤드를 줄이는 방향이에요.

토큰 단가 하락. 매년 모델 가격은 내려가고 있어요. GPT-4 수준의 성능이 오늘날 GPT-3.5 가격에 가능하듯, 오버헤드 부담 자체가 시간이 지나면서 줄어들 거예요.

지금 당장 해야 할 건 하나예요. 프로덕션 에이전트의 실제 토큰 로그를 열어서, 어느 스텝에서 얼마가 나오는지 숫자로 확인하는 것. 숫자를 모르면 줄일 수도 없어요.

MCP 토큰 비용에서 실제 청구 금액이 얼마나 나왔는지 직접 측정해봤나요? 팀에서 겪은 패턴이 있다면 댓글로 공유해줘요. 사례가 쌓일수록 더 정확한 분석이 가능하거든요.

관련 글

참고자료

  1. AI 에이전트 시대, AX가 기업 시스템을 재정의하다 | CIO
  2. MCP는 왜 Skills보다 토큰을 많이 먹을까
  3. 【AI】免费的代价?Google AI Studio 使用指南与 Cherry Studio + MCP 实战教程

Photo by Jonathan Kemper on Unsplash