맥북 M3 Pro 16GB에서 ollama + llama3.2 한국어 코드 리뷰 속도 측정

로컬 LLM을 맥북에서 돌린다고 했을 때, 가장 먼저 드는 걱정이 있죠. “느리지 않을까?”
그 걱정, 2026년 기준으로 다시 살펴볼 필요가 있어요. Ollama와 llama3.2의 조합은 M3 Pro 16GB 맥북에서 생각보다 훨씬 쓸 만한 속도를 보여주고 있거든요. 특히 한국어 코드 리뷰 워크플로우에서요.
이 글은 실제 벤치마크 데이터와 커뮤니티 측정치를 바탕으로, 맥북 M3 Pro 16GB에서 ollama + llama3.2 조합이 한국어 코드 리뷰에 실제로 쓸 수 있는 수준인지를 분석해요.
핵심 요약
- 맥북 M3 Pro 16GB는 llama3.2:3b 기준으로 약 40-60 tokens/sec를 기록하며, 간단한 코드 리뷰 응답을 5-10초 내에 생성해요.
- 한국어 프롬프트는 영어 대비 토큰 수가 약 1.5-2배 많아, 체감 속도는 영어보다 느리게 느껴지지만 실용 수준은 충분해요.
- llama3.2:3b는 메모리 부담이 거의 없지만 코드 리뷰 품질은 제한적이고, llama3.2:11b는 M3 Pro 16GB에서 메모리 압박이 시작돼요.
- Ollama의 Metal 백엔드 덕분에 M 시리즈 칩은 CPU 전용 대비 토큰 생성 속도가 세 배에서 네 배 빨라요.
M3 Pro의 숨겨진 강점
2025년 하반기부터 개발자 커뮤니티에서 조용히 주목받기 시작한 흐름이 있어요. API 비용 부담, 코드 개인정보 이슈, 인터넷 없이도 돌아가는 AI에 대한 수요가 동시에 올라온 거예요.
애플 M 시리즈 칩이 이 맥락에서 중요한 이유는 하나예요. 통합 메모리(Unified Memory) 구조. CPU와 GPU가 같은 메모리 풀을 공유하니까, LLM이 GPU VRAM 부족으로 느려지는 문제가 없어요. 일반 노트북에서 NVIDIA GPU 8GB VRAM이 가득 차면 모델 가중치가 RAM으로 내려가고 속도가 급락하는 현상, M3 Pro에선 그게 없죠.
Localaimaster.com의 2026년 가이드에 따르면, Ollama는 M 시리즈 칩에서 Apple의 Metal GPU 가속을 기본으로 쓰고, 이 덕분에 CPU 전용 실행 대비 토큰 생성 속도가 세 배에서 네 배 빨라요. M3 Pro에서 llama3.2:3b를 돌리면 약 45-60 tokens/sec가 나오는데, 이건 사람이 텍스트를 읽는 속도(평균 4-5 tokens/sec)보다 훨씬 빠른 수준이에요.
그런데 한국어 코드 리뷰 용도로 쓴다면 얘기가 조금 달라져요.
한국어 토큰화의 현실: 영어랑 다른 이유
LLM은 텍스트를 토큰 단위로 처리해요. 영어는 단어 하나가 대략 토큰 1-1.5개인데, 한국어는 음절 기반 토큰화 때문에 같은 의미를 전달하는 데 토큰이 1.5-2배 더 들어요. llama3.2가 쓰는 tiktoken 계열 토크나이저 기준으로, “이 함수의 반환값 처리가 잘못됐어요"는 약 15-18 토큰이에요. 같은 의미의 영어 “The return value handling in this function is incorrect"는 11-12 토큰이고요.
즉, 초당 토큰 속도가 같아도 한국어 응답은 더 오래 걸려요. 200 토큰짜리 한국어 코드 리뷰 답변이 완성되는 데 약 4-5초. 영어로 같은 내용이면 2-3초예요.
느린 건가요? 맥락을 보면 그렇지 않아요. GitHub Copilot 같은 클라우드 API도 네트워크 지연 포함하면 2-5초 응답이 일반적이에요. 오프라인 로컬 실행이 이 수준이면 충분히 쓸 만해요.
실제 속도 측정: 모델 크기별 비교
llama3.2:3b — 빠르지만 얕다
M3 Pro 16GB에서 llama3.2:3b는 약 50-60 tokens/sec가 나와요. 모델 로딩 시간은 첫 실행 기준 약 2-3초, 이후 캐시되면 0.5초 이하예요.
한국어 코드 리뷰 품질은 간단한 버그(누락된 null 체크, 오타 수준의 오류)는 잡아내지만, 아키텍처 피드백이나 복잡한 로직 분석은 3b 모델 용량의 한계가 보여요.
llama3.2:11b — 품질은 올라가지만 메모리 압박 시작
11b 모델은 양자화 방식에 따라 다른데, 4비트 양자화(Q4_K_M) 기준 약 6.5GB를 써요. M3 Pro 16GB에서 OS와 기타 앱이 약 4-5GB를 쓰고 있다면 메모리 여유가 빠듯해요.
속도는 약 18-25 tokens/sec로 뚝 떨어지고, 메모리 압박이 시작되면 더 느려져요. 그래도 한국어 코드 리뷰 품질은 3b 대비 눈에 띄게 나아져요. 함수 단위 리팩토링 제안이나 보안 취약점 지적 수준까지 올라가거든요.
모델 비교 요약
| 비교 항목 | llama3.2:3b | llama3.2:11b (Q4) | llama3.2:11b (Q8) |
|---|---|---|---|
| 모델 파일 크기 | ~2GB | ~6.5GB | ~12GB |
| M3 Pro 토큰 속도 | 50-60 t/s | 18-25 t/s | 8-12 t/s |
| 한국어 응답 (200토큰) | ~4초 | ~10초 | ~20초 |
| 코드 리뷰 깊이 | 기본 버그 탐지 | 리팩토링 제안 가능 | 아키텍처 수준 분석 |
| 16GB 메모리 여유 | 충분 | 빠듯 | 부족 (스왑 발생) |
| 적합도 (16GB 기준) | ✅ 쾌적 | ⚠️ 주의 | ❌ 비권장 |
Q8 양자화는 M3 Pro 16GB에선 사실상 비권장이에요. 시스템 메모리가 스왑을 시작하면 속도가 5 tokens/sec 아래로 떨어지고, 팬 소음도 올라가요.
실용적 판단: 언제 쓰고 언제 안 쓰나
시나리오 1: 오프라인 환경의 코드 리뷰 보조
네트워크가 없거나 코드 보안이 중요한 환경이라면 llama3.2:3b가 최선이에요. 빠르고 메모리 부담 없고, PR 단위 자동 코멘트 파이프라인에 붙이기도 좋아요. 품질 기대치를 “신입 개발자 수준의 1차 검토"로 잡으면 실망 없어요.
시나리오 2: 메인 AI 도구로 쓰고 싶다면
M3 Pro 16GB에서 llama3.2:11b를 메인으로 쓰는 건 무리예요. 크롬 탭 여러 개 열어두면 메모리가 바로 빠듯해지고, 응답이 느려지기 시작하면 GitHub Copilot API 요금이 오히려 싸게 느껴질 거예요. 이 용도라면 M3 Max 36GB 이상을 봐야 해요.
시나리오 3: 한국어 코드 리뷰 프롬프트 설계
어떤 모델을 써도 공통으로 해야 할 게 있어요. 시스템 프롬프트를 영어로 쓰고, 코드만 붙여 넣는 방식이 순수 한국어 프롬프트보다 토큰 효율이 20-30% 좋아요. 코드는 언어 중립적이고, llama3.2는 영어 지시에 더 잘 반응하거든요.
앞으로 주시할 신호:
- Ollama 팀은 2026년 내로 Metal 백엔드 추가 최적화를 예고했어요. llama3.2:3b 기준 70 tokens/sec 이상 목표라고 해요.
- llama3.2의 후속 모델이 더 작은 파라미터로 한국어 성능을 올리는 방향으로 개발 중이에요.
- Apple M4 Pro 24GB 기본 구성이 로컬 LLM 개발자들의 새로운 기준 하드웨어로 떠오르고 있어요.
결론: 3b는 지금 당장, 11b는 나중에
정리하면 이래요.
- llama3.2:3b + M3 Pro 16GB 조합은 한국어 코드 리뷰 보조 도구로 지금 당장 써도 돼요. 속도 50-60 t/s, 메모리 여유 충분, 오프라인 작동.
- llama3.2:11b는 이 조합에선 품질과 속도 사이 트레이드오프가 너무 가혹해요. 더 많은 RAM이 필요해요.
- 한국어 토큰 특성상 영어 대비 체감 속도가 느리지만, 실제 대기 시간은 클라우드 API와 비슷한 수준이에요.
결국 로컬 LLM의 가치는 속도가 아니에요. 코드가 외부 서버를 거치지 않는다는 것, 그게 2026년 기준으로 많은 팀에게 결정적인 이유가 되고 있어요.
지금 M3 Pro가 있다면, 오늘 Ollama 설치하고 llama3.2:3b로 PR 하나만 리뷰해 보세요. 3b 모델이 뭘 잡아내는지, 뭘 놓치는지 직접 보면 다음에 어떤 모델이 필요한지 감이 와요.
참고자료
- Ollama Just Got 2x Faster on Mac (Here’s How) - YouTube
- r/LocalLLaMA on Reddit: Ran Qwen 3.5 9B on M1 Pro (16GB) as an actual agent, not just a chat demo. H
- Run Llama 3 on Mac M1/M2/M3/M4: 2026 Step-by-Step Guide | Local AI Master


