테크 경제

Grok 4.7 한국어 성능 챗GPT랑 비교해봤다: 가격 절반, 코딩은 뒤처져

Grok 4.7 한국어 성능 챗GPT랑 비교해봤다: 가격 절반, 코딩은 뒤처져

코딩 벤치마크에서 GPT-6 Astra 점수의 절반도 못 받는 모델이 가격은 두 배 저렴하게 나왔어요. xAI의 Grok 4.7 얘기예요.

핵심 요약

  • GPT-6(Astra)는 Terminal-Bench 4.0 에이전트 코딩에서 60%, Grok 4.7은 26% — 두 배 넘게 차이나요
  • Grok 4.7 가격은 입력 $2/백만 토큰, 출력 $6/백만 토큰으로 GPT-6·Claude Fable 5.1보다 훨씬 싸요
  • 법률·전기공학 특화 벤치마크에선 Grok 4.7이 경쟁자를 압도해요 (Harvey Legal: 19.6% vs GPT-5.6 Sol 2.5%)
  • 한국어 전용 공식 벤치마크 데이터는 현재 공개된 게 없어요 — 범용 지식 지표로 간접 추정해야 해요
  • 작업당 출력 토큰이 81k로 GPT-6 Astra(27k)의 세 배 — 비용 계산 시 주의 필요해요

1. 결론부터 말할게요

범용 작업이라면 GPT-6, 가격이 우선이라면 Grok 4.7이에요.

Artificial Analysis Intelligence Index v4.3.2 기준으로 GPT-6와 Claude Fable 5.1은 각각 53점, Grok 4.7은 46점이에요. 숫자만 보면 큰 차이 아닌 것 같지만, 에이전트 코딩 영역에서 격차가 확 벌어져요. Terminal-Bench 4.0에서 GPT-6 Astra 60%, Grok 4.7은 26%예요. 절반도 안 되는 거죠.

그런데 Grok 4.7이 더 나은 경우도 분명 있어요:

  • 법률 에이전트 작업: Harvey Legal Agent Benchmark에서 19.6% (GPT-5.6 Sol은 2.5%)
  • 전기공학 지식: EEBench에서 64.0%, 비교군 중 1위
  • 비용 민감한 스타트업: 입출력 가격 모두 프론티어 모델 중 최저가

단, Grok 4.7을 선택하지 말아야 할 경우도 있어요. 에이전트 기반 소프트웨어 개발 파이프라인을 돌린다면, 비용 절감 효과보다 성능 손실이 훨씬 커요. DeepSeek V4.1 Flash(27%)에 겨우 1%p 차이나는 수준이거든요 — 엔터프라이즈 코딩 용도라면 GPT-6나 Claude Fable 5.1이 맞아요.

TL;DR

  • Grok 4.7 쓸 때: 법률·전기공학 도메인, API 비용 최소화, 전문 지식 Q&A
  • GPT-6 쓸 때: 복잡한 코딩 에이전트, 범용 작업, 한국어 품질이 중요한 경우
  • 둘 다 건너뛸 때: 한국어 특화 성능이 최우선이라면, 국내 특화 모델 병행 검토 권장

2. 두 모델은 뭐예요?

Grok 4.7은 xAI가 2026년 9월 출시한 모델이에요. 전작 Grok 4.6보다 큰 베이스 아키텍처에 더 긴 강화학습 훈련을 거쳤고, 멀티아워 복잡 작업과 자기 검증 능력에 초점을 뒀어요. xAI 공식 발표에 따르면 가격은 입력 $2/백만 토큰, 출력 $6/백만 토큰으로 전작과 동일하게 유지됐어요. Cursor, Grok Build, xAI API를 통해 쓸 수 있고, 속도는 약 188 토큰/초예요.

**GPT-6 (Astra 포함)**는 OpenAI의 현재 프론티어 라인이에요. Claude Fable 5.1과 함께 Intelligence Index 53점으로 현재 최상위 그룹을 형성하고 있어요. Terminal-Bench 4.0에서 60%로 에이전트 코딩 1위예요. 가격은 Grok 4.7보다 높게 책정돼 있어요. 한국어 지원 면에서는 공식 벤치마크 데이터는 없지만, GDPval 같은 광범위한 전문 지식 지표에서 상위권을 유지하고 있어요.


3. 직접 비교해봤어요

비교 항목Grok 4.7GPT-6승자
API 입력 가격 (1M 토큰)$2더 높음Grok 4.7
범용 지능 지수 (AA Index v4.3.2)46/10053/100GPT-6
에이전트 코딩 (Terminal-Bench 4.0)26%60%GPT-6
소프트웨어 엔지니어링 (DeepSWE v1.1)71–73%Grok 4.7 (기준 없음)
법률 에이전트 (Harvey Legal)19.6%2.5% (GPT-5.6 Sol 기준)Grok 4.7
전기공학 (EEBench)64.0%Grok 4.7 (비교군 1위)
전문 지식 (GDPval Elo)1,695Claude Fable 5.1 (1,735)
작업당 출력 토큰81,00027,000GPT-6 (효율)
환각률 (AA-Omniscience)29%Grok 4.7 (전작比 개선)
컨텍스트 윈도우500k비교 데이터 없음

출처: Artificial Analysis, xAI 공식 발표, The Decoder


표에서 가장 눈에 띄는 건 에이전트 코딩 격차예요. 26% vs 60%는 단순한 점수 차이가 아니에요 — 실제 파이프라인에서 실패율이 두 배 이상 차이난다는 뜻이거든요. 더 충격적인 건 Grok 4.7이 DeepSeek V4.1 Flash(27%)에도 밀린다는 점이에요. 저가 모델에 이런 영역에서 지면 가격 이점이 희석돼요.

반면 법률 벤치마크 격차는 반대 방향이에요. Harvey Legal Agent Benchmark에서 19.6%라는 수치는, GPT-5.6 Sol의 2.5%와 비교하면 거의 여덟 배 차이예요. xAI가 장기간 멀티스텝 추론에 강화학습을 집중한 결과가 법률·의학처럼 복잡한 문서 작업에서 나오는 것 같아요.

출력 토큰 소비는 조금 더 설명이 필요해요. Grok 4.7은 작업당 평균 81,000 토큰을 소비하는데, GPT-6 Astra는 27,000 토큰이에요. 입력 가격이 저렴해도 출력이 세 배 많으면 실질 비용이 역전될 수 있어요. API 비용 계산할 때 출력 토큰 기준으로 반드시 다시 따져봐야 해요.

한국어 성능에 대해서는 두 모델 모두 한국어 전용 공식 벤치마크를 현재 공개하지 않아요. GDPval(전문 지식 Elo)이나 AA-Briefcase(지식 작업) 같은 범용 지표에서 Grok 4.7은 1,695 Elo로 Claude Fable 5.1(1,735)에 약간 뒤처지고, GPT-6와는 직접 비교 데이터가 없어요. 한국어 성능이 핵심이라면 별도 테스트를 거치는 걸 권해요.


4. 각각 어디서 무너지냐면요

Grok 4.7이 무너지는 경우: 에이전트 코딩 작업이에요. Terminal-Bench 4.0에서 26%는 단순히 낮은 게 아니라, 동급 저가 모델인 DeepSeek V4.1 Flash(27%)에도 뒤처지는 수준이에요. The Decoder 분석에 따르면 최상위 두 추론 레벨의 성능 차이가 거의 없어, 고난도 코딩에서 더 많이 생각해도 결과가 안 달라지는 문제가 있어요. CI/CD 파이프라인에 넣으면 실패 비율이 눈에 띄게 높아질 거예요.

GPT-6가 무너지는 경우: 비용 구조가 타이트한 스타트업 환경이에요. 가격 자체가 Grok 4.7보다 높은데, 특수 도메인(법률, 전기공학, 생명과학)에서는 성능이 Grok 4.7보다 낮아요. Harvey Legal에서 2.5%는 실제 프로덕션 법률 에이전트에 쓰기엔 너무 낮은 수치예요. 도메인이 특정되어 있고 비용이 중요한 상황이라면, 더 비싸면서 성능도 낮은 모델을 쓰는 셈이 돼요.


5. 최종 판단이에요

결론은 처음과 같아요: 범용 코딩·한국어 작업이라면 GPT-6, 법률·전기공학·비용 최적화라면 Grok 4.7이에요.

AA Intelligence Index 46 vs 53, Terminal-Bench 코딩 26% vs 60%라는 데이터는 명확한 격차를 보여줘요. 하지만 Harvey Legal 19.6% vs 2.5%, EEBench 1위라는 수치는 도메인 특화에서 완전히 다른 그림을 그려줘요. 두 모델이 동시에 좋은 영역은 없어요 — 겹치는 구간이 없다는 게 오히려 선택을 쉽게 만들어줘요.

지금 바로 할 수 있는 것: xAI API에서 Grok 4.7 무료 티어로 접근한 뒤, 자신이 실제로 쓰는 프롬프트 다섯 개를 GPT-6와 나란히 돌려보세요. 10분이면 벤치마크보다 훨씬 유용한 데이터를 얻을 수 있어요.

앞으로 주시할 질문 하나: xAI가 에이전트 코딩 갭(26%)을 Grok 4.8이나 다음 버전에서 메꿀 수 있을까요? 법률 같은 도메인 특화에서 앞서는 모델이 코딩까지 잡으면, 가격 경쟁력까지 더해져 시장 판도가 달라질 수 있거든요.

참고자료

  1. Grok - 나무위키
  2. Introducing Grok 4.7 | SpaceXAI
  3. xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6

Photo by Mariia Berezovsky on Unsplash