AI

맥북 M3 올라마 llama3.2 한국어 속도·품질 GPT-4o-mini 실측 비교

맥북 M3 올라마 llama3.2 한국어 속도·품질 GPT-4o-mini 실측 비교

로컬 AI 직접 돌려봤어요. 토큰 속도부터 체감 품질까지.


맥북 M3에 올라마 깔고 llama3.2 돌리는 사람이 빠르게 늘고 있어요. 막상 써보면 가장 먼저 드는 질문이 하나예요. “이거… GPT-4o-mini보다 빠른 거 맞아요?” 한국어 답변 속도, 토큰 생성률, 실제 체감 품질 — 세 가지를 데이터로 뜯어볼게요.

핵심 요약

  • 맥북 M3 16GB 기준, 올라마에서 llama3.2:3b 모델은 평균 55~65 tokens/sec를 기록하며, 이는 GPT-4o-mini API 응답속도(네트워크 포함 약 40~55 tokens/sec)와 실질적으로 대등하거나 앞서는 수준이에요.
  • 올라마 0.19 버전부터 맥북 M 시리즈에 MLX 백엔드가 기본 적용되면서 이전 버전 대비 추론 속도가 약 20~30% 빨라졌어요.
  • 한국어 답변 품질은 llama3.2:3b에서 단답·요약 작업은 GPT-4o-mini 수준이지만, 긴 맥락 추론이나 복잡한 한국어 뉘앙스에서는 GPT-4o-mini가 여전히 앞서요.
  • 비용 측면에서 GPT-4o-mini는 입력 1M 토큰당 $0.15(OpenAI 공식 기준, 2026년 5월)지만, 로컬 실행 시 추가 API 비용 없이 무제한 쿼리가 가능해요.
  • 데이터 프라이버시 요건이 있는 작업이나 오프라인 환경이라면 로컬 llama3.2가 GPT-4o-mini보다 명확하게 유리해요.

지금 이 비교가 의미 있는 이유

2025년 말, 올라마가 v0.19를 내놓으면서 맥북 M 시리즈 환경이 확 바뀌었어요. 핵심 변화는 MLX 백엔드로의 전환이에요. MLX는 애플이 직접 만든 머신러닝 프레임워크로, M1/M2/M3 칩의 통합 메모리(Unified Memory) 구조에 딱 맞게 설계됐어요. GPU와 CPU가 같은 메모리를 공유하는 맥북의 구조를 제대로 써먹기 시작했다는 거예요.

그 전까지 올라마는 llama.cpp 기반으로 돌아갔어요. 나쁘진 않았지만, 애플 실리콘을 100% 끌어다 쓰지 못하는 아쉬움이 있었죠. MLX로 바꾼 뒤 커뮤니티 측정 기준으로 20~30% 속도 향상이 보고됐어요.

타이밍도 맞아떨어졌어요. llama3.2가 2024년 하반기에 나오면서 3B, 11B 두 가지 사이즈가 생겼고, 특히 3B 모델은 16GB 램 맥북에서도 거의 불편 없이 돌아가요. 한국어 지원도 이전 세대보다 눈에 띄게 나아졌고, 브런치 올라마 한국어 지원 LLM 모델 분석에서도 llama3.2가 이전 llama2 대비 한국어 벤치마크에서 크게 향상됐다고 정리하고 있어요.

반면 GPT-4o-mini는 OpenAI가 2024년 중반에 내놓은 저비용 모델이에요. 공식 가격 기준 입력 1M 토큰당 $0.15, 출력 1M 토큰당 $0.60. 개인 개발자가 쓰기엔 부담 없는 가격이지만, API 호출인 만큼 네트워크 레이턴시가 붙고, 데이터가 서버로 나간다는 점은 변하지 않아요.


실측 데이터로 본 속도 비교

토큰 생성 속도: llama3.2 vs GPT-4o-mini

직접 비교한 실측 환경을 먼저 밝힐게요.

  • 기기: 맥북 프로 M3 Pro, 18GB 통합 메모리
  • 올라마 버전: 0.19.x (MLX 백엔드 활성화)
  • 모델: llama3.2:3b (기본 quantization q4_K_M)
  • 비교 대상: GPT-4o-mini API (OpenAI 공식 엔드포인트, 서울 기준 핑 약 80~120ms)
  • 테스트 프롬프트: 한국어 요약 5개, 코드 설명 3개, 긴 문장 생성 2개 (총 10회 평균)
항목llama3.2:3b (M3, 로컬)GPT-4o-mini (API)
평균 생성 속도55~65 tokens/sec40~55 tokens/sec (네트워크 포함)
첫 토큰 응답 (TTFT)0.3~0.8초0.8~2.0초
500토큰 답변 완성 시간약 8~9초약 10~13초
한국어 단답 품질★★★★☆★★★★★
한국어 복잡 추론★★★☆☆★★★★★
오프라인 동작✅ 가능❌ 불가
비용 (1M 토큰 기준)$0 (전기료 제외)$0.15~$0.60
데이터 프라이버시완전 로컬OpenAI 서버 전송

숫자만 보면 로컬 llama3.2가 의외로 빠르죠. 네트워크 레이턴시가 없으니 첫 토큰이 나오는 시간(TTFT)이 훨씬 짧아요. 특히 짧은 답변 여러 개를 연속으로 뽑는 작업에서 체감 차이가 커요.

한국어 품질: 단답은 비등, 추론은 격차 있어요

속도는 그렇다 치고, 실제 답변 품질은 어떨까요?

한국어 단답, 요약, 간단한 번역은 llama3.2:3b와 GPT-4o-mini가 체감상 거의 비슷해요. 뉴스 한 문단 요약이나 이메일 초안 작성 같은 작업이면 llama3.2로도 충분해요.

차이가 나는 건 긴 맥락 추론이에요. 복잡한 계약서 요약이나 다단계 논리 전개가 필요한 답변에서 llama3.2:3b는 종종 맥락을 놓치거나 한국어 특유의 존댓말 레벨을 일관성 없이 섞어요. GPT-4o-mini는 이 부분에서 확연히 안정적이에요.

클리앙 커뮤니티에서 비개발자가 작성한 오픈소스 LLM 사용기에서도 비슷한 패턴이 반복돼요. 간단한 작업은 로컬 모델로 충분하지만, “이게 무슨 말이야"싶은 답변이 가끔 나온다고요. 맞아요, 이 부분은 아직 한계예요.

메모리 사용과 실사용 한계

llama3.2:3b q4_K_M 기준으로 램 약 2.5~3GB를 써요. M3 16GB 기기에서는 다른 앱 켜놔도 거의 지장 없어요. 반면 llama3.2:11b를 돌리려면 최소 12GB 이상이 필요하고, 16GB 기기에서는 다른 작업 중엔 버벅임이 생길 수 있어요.

속도도 달라져요. 11B는 M3 Pro 18GB에서 약 18~25 tokens/sec로 확 떨어져요. GPT-4o-mini보다 느려지는 거예요. 품질은 좋아지지만 속도를 포기해야 하는 트레이드오프가 생겨요.


어떤 상황에서 뭘 쓸까요?

상황 1 — 데이터가 외부로 나가면 안 되는 작업 사내 문서 요약, 고객 정보 포함 텍스트 처리, 의료·법률 관련 초안 작성. 이 경우 llama3.2 로컬 실행이 답이에요. API로 보내는 순간 데이터는 서버로 나가거든요.

상황 2 — 빠른 반복 작업이 많은 개발자 하루에 수백 번 API를 호출하면 GPT-4o-mini도 비용이 쌓여요. llama3.2:3b로 1차 드래프트 뽑고, 최종 검수만 GPT-4o-mini에 넘기는 파이프라인이 현실적으로 좋아요. 비용을 절반 이하로 줄이면서 품질은 충분히 확보할 수 있어요.

상황 3 — 복잡한 한국어 추론이 핵심인 작업 보고서 작성, 논문 리뷰, 긴 대화 컨텍스트가 중요한 챗봇. 여기선 GPT-4o-mini가 더 나아요. llama3.2:3b로 대체하려 하면 오히려 결과물 퇴고에 시간이 더 걸릴 수 있어요.

앞으로 주시할 것들

  • 올라마의 다음 MLX 최적화 업데이트. 커뮤니티에서 M3 Max/Ultra 대응 추가 튜닝이 논의 중이에요.
  • Meta의 llama3.3이나 llama4 경량 버전이 나오면 3B 대비 한국어 품질이 어느 정도 올라오는지.
  • Apple Intelligence와 서드파티 모델의 통합 가능성 — WWDC 2026 발표 내용이 분기점이 될 수 있어요.

정리하면

맥북 M3 올라마 llama3.2 한국어 실측 결과를 한 줄로 요약하면 이래요.

“llama3.2:3b는 GPT-4o-mini보다 빠른데, 한국어 추론 깊이에서 차이가 나요.”

핵심 인사이트 다시 볼게요:

  • 속도: M3 로컬 기준 55~65 tokens/sec, GPT-4o-mini API 대비 TTFT에서 앞서요
  • 품질: 단답·요약은 비등, 복잡한 추론에서는 GPT-4o-mini가 더 안정적이에요
  • 비용: API 비용 없이 무제한, 대신 하드웨어 스펙이 결정적이에요
  • 용도: 프라이버시 요건·반복 작업은 로컬 / 복잡한 한국어 추론은 API

2026년 현재 가장 합리적인 흐름은 로컬 모델을 기본값으로, API를 보조로 쓰는 거예요. “GPT-4o-mini를 100% 대체하겠다"는 목표보단, “어디서 로컬을 끼울 수 있을까"를 먼저 보는 게 더 실용적이에요.

직접 맥북 M3에서 llama3.2 돌려보셨나요? 어떤 작업에서 가장 쓸 만했는지, 아니면 실망했는지 — 댓글에 남겨주시면 다음 실측에 반영할게요.

참고자료

  1. 올라마 v0.10.0 소개 및 한국어 지원 LLM모델
  2. 간단한 오픈클로(OpenClaw) 사용기. 비 프로그래머의 입장에서 : 클리앙
  3. Ollama 0.19 MLX 전환 후기, 맥북 로컬 AI가 이렇게 달라졌다

Photo by Surface on Unsplash