Grok 4.7 한국어 성능 챗GPT랑 비교해봤다: 가격 절반, 코딩은 뒤처져

코딩 벤치마크에서 GPT-6 Astra 점수의 절반도 못 받는 모델이 가격은 두 배 저렴하게 나왔어요. xAI의 Grok 4.7 얘기예요.
핵심 요약
- GPT-6(Astra)는 Terminal-Bench 4.0 에이전트 코딩에서 60%, Grok 4.7은 26% — 두 배 넘게 차이나요
- Grok 4.7 가격은 입력 $2/백만 토큰, 출력 $6/백만 토큰으로 GPT-6·Claude Fable 5.1보다 훨씬 싸요
- 법률·전기공학 특화 벤치마크에선 Grok 4.7이 경쟁자를 압도해요 (Harvey Legal: 19.6% vs GPT-5.6 Sol 2.5%)
- 한국어 전용 공식 벤치마크 데이터는 현재 공개된 게 없어요 — 범용 지식 지표로 간접 추정해야 해요
- 작업당 출력 토큰이 81k로 GPT-6 Astra(27k)의 세 배 — 비용 계산 시 주의 필요해요
1. 결론부터 말할게요
범용 작업이라면 GPT-6, 가격이 우선이라면 Grok 4.7이에요.
Artificial Analysis Intelligence Index v4.3.2 기준으로 GPT-6와 Claude Fable 5.1은 각각 53점, Grok 4.7은 46점이에요. 숫자만 보면 큰 차이 아닌 것 같지만, 에이전트 코딩 영역에서 격차가 확 벌어져요. Terminal-Bench 4.0에서 GPT-6 Astra 60%, Grok 4.7은 26%예요. 절반도 안 되는 거죠.
그런데 Grok 4.7이 더 나은 경우도 분명 있어요:
- 법률 에이전트 작업: Harvey Legal Agent Benchmark에서 19.6% (GPT-5.6 Sol은 2.5%)
- 전기공학 지식: EEBench에서 64.0%, 비교군 중 1위
- 비용 민감한 스타트업: 입출력 가격 모두 프론티어 모델 중 최저가
단, Grok 4.7을 선택하지 말아야 할 경우도 있어요. 에이전트 기반 소프트웨어 개발 파이프라인을 돌린다면, 비용 절감 효과보다 성능 손실이 훨씬 커요. DeepSeek V4.1 Flash(27%)에 겨우 1%p 차이나는 수준이거든요 — 엔터프라이즈 코딩 용도라면 GPT-6나 Claude Fable 5.1이 맞아요.
TL;DR
- Grok 4.7 쓸 때: 법률·전기공학 도메인, API 비용 최소화, 전문 지식 Q&A
- GPT-6 쓸 때: 복잡한 코딩 에이전트, 범용 작업, 한국어 품질이 중요한 경우
- 둘 다 건너뛸 때: 한국어 특화 성능이 최우선이라면, 국내 특화 모델 병행 검토 권장
2. 두 모델은 뭐예요?
Grok 4.7은 xAI가 2026년 9월 출시한 모델이에요. 전작 Grok 4.6보다 큰 베이스 아키텍처에 더 긴 강화학습 훈련을 거쳤고, 멀티아워 복잡 작업과 자기 검증 능력에 초점을 뒀어요. xAI 공식 발표에 따르면 가격은 입력 $2/백만 토큰, 출력 $6/백만 토큰으로 전작과 동일하게 유지됐어요. Cursor, Grok Build, xAI API를 통해 쓸 수 있고, 속도는 약 188 토큰/초예요.
**GPT-6 (Astra 포함)**는 OpenAI의 현재 프론티어 라인이에요. Claude Fable 5.1과 함께 Intelligence Index 53점으로 현재 최상위 그룹을 형성하고 있어요. Terminal-Bench 4.0에서 60%로 에이전트 코딩 1위예요. 가격은 Grok 4.7보다 높게 책정돼 있어요. 한국어 지원 면에서는 공식 벤치마크 데이터는 없지만, GDPval 같은 광범위한 전문 지식 지표에서 상위권을 유지하고 있어요.
3. 직접 비교해봤어요
| 비교 항목 | Grok 4.7 | GPT-6 | 승자 |
|---|---|---|---|
| API 입력 가격 (1M 토큰) | $2 | 더 높음 | Grok 4.7 |
| 범용 지능 지수 (AA Index v4.3.2) | 46/100 | 53/100 | GPT-6 |
| 에이전트 코딩 (Terminal-Bench 4.0) | 26% | 60% | GPT-6 |
| 소프트웨어 엔지니어링 (DeepSWE v1.1) | 71–73% | — | Grok 4.7 (기준 없음) |
| 법률 에이전트 (Harvey Legal) | 19.6% | 2.5% (GPT-5.6 Sol 기준) | Grok 4.7 |
| 전기공학 (EEBench) | 64.0% | — | Grok 4.7 (비교군 1위) |
| 전문 지식 (GDPval Elo) | 1,695 | — | Claude Fable 5.1 (1,735) |
| 작업당 출력 토큰 | 81,000 | 27,000 | GPT-6 (효율) |
| 환각률 (AA-Omniscience) | 29% | — | Grok 4.7 (전작比 개선) |
| 컨텍스트 윈도우 | 500k | — | 비교 데이터 없음 |
출처: Artificial Analysis, xAI 공식 발표, The Decoder
표에서 가장 눈에 띄는 건 에이전트 코딩 격차예요. 26% vs 60%는 단순한 점수 차이가 아니에요 — 실제 파이프라인에서 실패율이 두 배 이상 차이난다는 뜻이거든요. 더 충격적인 건 Grok 4.7이 DeepSeek V4.1 Flash(27%)에도 밀린다는 점이에요. 저가 모델에 이런 영역에서 지면 가격 이점이 희석돼요.
반면 법률 벤치마크 격차는 반대 방향이에요. Harvey Legal Agent Benchmark에서 19.6%라는 수치는, GPT-5.6 Sol의 2.5%와 비교하면 거의 여덟 배 차이예요. xAI가 장기간 멀티스텝 추론에 강화학습을 집중한 결과가 법률·의학처럼 복잡한 문서 작업에서 나오는 것 같아요.
출력 토큰 소비는 조금 더 설명이 필요해요. Grok 4.7은 작업당 평균 81,000 토큰을 소비하는데, GPT-6 Astra는 27,000 토큰이에요. 입력 가격이 저렴해도 출력이 세 배 많으면 실질 비용이 역전될 수 있어요. API 비용 계산할 때 출력 토큰 기준으로 반드시 다시 따져봐야 해요.
한국어 성능에 대해서는 두 모델 모두 한국어 전용 공식 벤치마크를 현재 공개하지 않아요. GDPval(전문 지식 Elo)이나 AA-Briefcase(지식 작업) 같은 범용 지표에서 Grok 4.7은 1,695 Elo로 Claude Fable 5.1(1,735)에 약간 뒤처지고, GPT-6와는 직접 비교 데이터가 없어요. 한국어 성능이 핵심이라면 별도 테스트를 거치는 걸 권해요.
4. 각각 어디서 무너지냐면요
Grok 4.7이 무너지는 경우: 에이전트 코딩 작업이에요. Terminal-Bench 4.0에서 26%는 단순히 낮은 게 아니라, 동급 저가 모델인 DeepSeek V4.1 Flash(27%)에도 뒤처지는 수준이에요. The Decoder 분석에 따르면 최상위 두 추론 레벨의 성능 차이가 거의 없어, 고난도 코딩에서 더 많이 생각해도 결과가 안 달라지는 문제가 있어요. CI/CD 파이프라인에 넣으면 실패 비율이 눈에 띄게 높아질 거예요.
GPT-6가 무너지는 경우: 비용 구조가 타이트한 스타트업 환경이에요. 가격 자체가 Grok 4.7보다 높은데, 특수 도메인(법률, 전기공학, 생명과학)에서는 성능이 Grok 4.7보다 낮아요. Harvey Legal에서 2.5%는 실제 프로덕션 법률 에이전트에 쓰기엔 너무 낮은 수치예요. 도메인이 특정되어 있고 비용이 중요한 상황이라면, 더 비싸면서 성능도 낮은 모델을 쓰는 셈이 돼요.
5. 최종 판단이에요
결론은 처음과 같아요: 범용 코딩·한국어 작업이라면 GPT-6, 법률·전기공학·비용 최적화라면 Grok 4.7이에요.
AA Intelligence Index 46 vs 53, Terminal-Bench 코딩 26% vs 60%라는 데이터는 명확한 격차를 보여줘요. 하지만 Harvey Legal 19.6% vs 2.5%, EEBench 1위라는 수치는 도메인 특화에서 완전히 다른 그림을 그려줘요. 두 모델이 동시에 좋은 영역은 없어요 — 겹치는 구간이 없다는 게 오히려 선택을 쉽게 만들어줘요.
지금 바로 할 수 있는 것: xAI API에서 Grok 4.7 무료 티어로 접근한 뒤, 자신이 실제로 쓰는 프롬프트 다섯 개를 GPT-6와 나란히 돌려보세요. 10분이면 벤치마크보다 훨씬 유용한 데이터를 얻을 수 있어요.
앞으로 주시할 질문 하나: xAI가 에이전트 코딩 갭(26%)을 Grok 4.8이나 다음 버전에서 메꿀 수 있을까요? 법률 같은 도메인 특화에서 앞서는 모델이 코딩까지 잡으면, 가격 경쟁력까지 더해져 시장 판도가 달라질 수 있거든요.
참고자료
- Grok - 나무위키
- Introducing Grok 4.7 | SpaceXAI
- xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6
Photo by Mariia Berezovsky on Unsplash


