AI

M3 맥북에서 Ollama Llama 3.2 한국어 답변 품질·토큰 속도·메모리 실측

M3 맥북에서 Ollama Llama 3.2 한국어 답변 품질·토큰 속도·메모리 실측

“로컬 LLM을 써볼까?” 하다가 속도 걱정에 그냥 클라우드 구독 유지하고 있는 거죠?

실측 데이터 먼저 보면 생각이 바뀔 수 있어요.

M3 맥북에서 Ollama로 Llama 3.2를 돌리면 초당 3050 토큰이 나와요. 한국어 답변 품질도 GPT-4o의 6070% 수준까지 올라왔고요. 2026년 기준으로, 로컬 AI 환경은 생각보다 훨씬 쓸 만해졌어요.

핵심 요약

  • M3 맥북 Pro 16GB에서 Ollama + Llama 3.2 3B 모델은 평균 45 토큰/초, 실시간 대화에 충분한 속도예요.
  • 한국어 답변 품질은 영어 대비 약 15~20% 낮지만, 간단한 Q&A와 요약 작업에서는 실용적인 성능이 나와요.
  • 메모리는 3B가 약 2.5GB, 8B가 약 5.5GB — 16GB 맥북에서도 여유 있게 돌아가요.
  • EXAONE 3.5, Qwen 3.5 같은 한국어 특화 모델이 등장하면서 Llama 단독 시대는 저물고 있어요.

지금 M3 맥북 + 로컬 LLM인 이유

로컬 LLM 관심이 폭발한 건 2024년 말부터예요. 클라우드 AI 요금 인상, 기업 데이터 보안 이슈, 애플 실리콘 성능 향상이 한 시점에 맞물렸거든요.

M3 칩은 전작 M2 대비 Neural Engine 성능이 약 60% 향상됐어요(Apple 공식 발표 기준). 단순 CPU 연산이 아니라 행렬 연산 — LLM이 토큰을 생성할 때 쓰는 연산에 직접 영향을 줘요. LocalAI Master의 2026년 가이드에 따르면, M3 Pro 이상에서 Llama 3 계열을 돌릴 때 M1 대비 약 두 배의 토큰 생성 속도가 나와요.

Ollama는 이 환경을 가장 쉽게 만들어주는 도구예요. 터미널에서 ollama run llama3.2만 치면 모델을 자동으로 내려받고 바로 실행돼요. Docker나 Python 환경 없이도요. Jeff Bailey의 블로그에서 정리한 것처럼, Ollama는 macOS의 Metal GPU 가속을 자동으로 잡아줘서 별도 설정 없이 최적 성능이 나오는 구조예요.

그런데 한국어 사용자에게 진짜 중요한 건 “빠른 게 전부인가?“가 아니에요. 빠르게 틀린 한국어가 나오면 의미가 없으니까요. 그래서 속도와 품질을 같이 볼게요.


실측 데이터: 속도와 메모리부터

토큰 생성 속도 — 생각보다 빨라요

모델맥북 사양토큰/초 (평균)첫 응답 대기 시간
Llama 3.2 3BM3 8GB약 35 tok/s0.8초
Llama 3.2 3BM3 Pro 18GB약 48 tok/s0.6초
Llama 3.2 8BM3 Pro 18GB약 28 tok/s1.2초
Llama 3.2 8BM3 Max 36GB약 42 tok/s0.9초

(LocalAI Master 2026 가이드 및 커뮤니티 실측 데이터 종합)

사람이 편하게 읽을 수 있는 속도가 초당 10~15 토큰이에요. 그 기준에서 보면, 3B 모델은 “거의 즉각 응답"처럼 느껴지고 8B도 충분히 쓸 만해요.

메모리 점유율 — 16GB도 괜찮아요

“16GB 맥북으로 LLM 돌리면 램이 다 차지 않나요?” 실측은 다른 이야기를 해요.

  • Llama 3.2 3B: 약 2.5GB RAM (Metal 버퍼 포함)
  • Llama 3.2 8B: 약 5.5GB RAM
  • VS Code + Chrome 기본 실행 시 약 4~6GB 사용

3B 모델은 Chrome 탭 몇 개와 VS Code를 열어둔 상태에서도 여유 있게 돌아가요. 8B는 다른 앱을 좀 닫아야 할 수 있고요. 이 차이가 실제 작업 환경에서 생각보다 크게 느껴져요.

한국어 답변 품질 — 제일 중요한 부분

2026년 로컬 LLM 한국어 성능 비교 데이터(hoft.tistory.com 기준)를 보면, Llama 3.2의 특성이 명확하게 나뉘어요.

  • 잘하는 것: 간단한 질의응답, 번역, 영문 코드 설명, 짧은 요약
  • 부족한 것: 복잡한 맥락 추론, 한국 고유 문화·관용어 이해, 긴 문서 요약의 일관성
  • 한국어 vs 영어 성능 갭: 약 15~20% (벤치마크 기준)

이 갭은 학습 데이터 때문이에요. 메타 공개 자료에 따르면 Llama 3 계열 학습 데이터에서 한국어 비중은 전체의 1~2% 수준이에요.


Llama 3.2 vs 한국어 특화 모델: 뭘 골라야 해요?

2026년 현재, Ollama에서 실행 가능한 한국어 친화적 모델이 여럿 생겼어요.

비교 항목Llama 3.2 8BEXAONE 3.5 7.8BQwen 3.5 8B
한국어 자연스러움★★★☆☆★★★★★★★★★☆
영어 코드·설명★★★★★★★★★☆★★★★☆
M3 맥북 토큰 속도~28 tok/s~24 tok/s~26 tok/s
메모리 점유 (8B급)~5.5GB~5.8GB~5.6GB
Ollama 지원✅ 공식✅ 지원✅ 공식
추천 용도영문 개발, 범용한국어 서비스한중 혼합

(hoft.tistory.com 2026년 로컬 LLM 비교 데이터 기반)

EXAONE 3.5는 LG AI 연구원이 만든 한국어 특화 모델이에요. 한국어 뉘앙스, 존댓말 처리, 고유명사 인식에서 Llama를 확실히 앞서요. 다만 속도는 약간 느리고, 영어 코딩 작업에서는 Llama 3.2가 더 나은 결과가 나와요.

Qwen 3.5는 중간 포지션이에요. 한국어도, 영어도 잘해요. 그런데 “두루 잘하는” 모델이다 보니 특정 작업에서 최고가 되지는 않아요.

정리하면 이렇게 나눠져요. 영문 코드 리뷰·영어 문서 요약이 주 목적이라면 Llama 3.2, 한국어 고객 응대나 한국어 글쓰기 보조가 목적이라면 EXAONE 3.5예요.


실제로 어떻게 쓰면 좋을까요?

개발자라면 지금 당장 시도해볼 수 있어요. Ollama 설치 후 ollama run llama3.2면 5분 이내로 로컬 LLM 환경이 생겨요. API 형태(http://localhost:11434/api)로도 쓸 수 있어서 VS Code에 로컬 모델을 붙이는 것도 가능해요. 비용이 0원이라는 점에서, 월 20달러 구독을 잠깐 멈추고 테스트해보기에 딱 좋은 시점이에요.

한국어 콘텐츠 작업이 많다면 모델 선택을 한 번 더 생각해야 해요. Llama 3.2로 시작하되, 한국어 품질이 아쉽다면 EXAONE 3.5로 교체하는 게 빠른 방법이에요. Ollama에서 두 모델 모두 ollama pull 한 줄로 설치되니 비교 자체는 어렵지 않아요.

앞으로 주시할 것 세 가지예요.

  • Llama 4 계열의 한국어 데이터 비중: 메타가 다국어 학습 비율을 늘릴지 여부
  • Apple Silicon 전용 최적화 모델: M4 Max 출시 후 Metal 가속을 적극 활용하는 모델 등장 예상
  • Ollama의 멀티모달 지원 확장: 텍스트 중심에서 이미지·음성 입력 지원으로 넓어지는 추세

정리하면

M3 맥북 + Ollama + Llama 3.2 조합은 2026년 기준으로 충분히 실용적이에요.

  • 속도: 3B 기준 45 tok/s, 8B도 28 tok/s — 실시간 대화에 무리 없어요
  • 메모리: 16GB에서 3B는 여유 있고, 8B는 타이트하게 가능해요
  • 한국어 품질: 영어 대비 15~20% 격차 — 범용엔 쓸 만하지만, 한국어 특화 작업엔 EXAONE이 나아요
  • 선택 기준: 영문 개발 작업 → Llama 3.2, 한국어 서비스 → EXAONE 3.5

로컬 LLM이 “언젠가 쓸 것"에서 “지금 쓸 수 있는 것"으로 바뀐 시점이 바로 지금이에요.

매달 클라우드 AI 구독료를 내고 있다면, 그 작업의 몇 퍼센트가 로컬 모델로 대체 가능한지 따져본 적 있나요? 생각보다 많을 거예요.

참고자료

  1. 2026 로컬 LLM 한국어 성능 심층 비교 — EXAONE vs Qwen 3.5 vs Gemma 4(RAG·에이전트 기준)
  2. What is Ollama? | Jeff Bailey
  3. Run Llama 3 on Mac M1/M2/M3/M4: 2026 Step-by-Step Guide | Local AI Master

Photo by Merakist on Unsplash