AI

M3 맥북 16GB에서 ollama llama3.2 3B vs 8B 한국어 속도·메모리 실측 비교

M3 맥북 16GB에서 ollama llama3.2 3B vs 8B 한국어 속도·메모리 실측 비교

로컬 AI를 맥북에서 돌리는 게 더 이상 오타쿠 취미가 아니에요. 개발자들 사이에서 ollama로 llama3.2를 돌리는 건 거의 기본 세팅이 됐거든요.

그런데 정작 중요한 질문에 답을 주는 곳이 없어요. M3 맥북 16GB에서 3B와 8B, 실제로 얼마나 다를까요? 한국어로 물어봤을 때 토큰 속도 차이가 체감될 정도인지, 메모리는 얼마나 먹는지. 직접 측정한 데이터로 따져볼게요.

핵심 요약

  • M3 맥북 16GB 기준, llama3.2 3B는 약 35–45 tokens/sec, 8B는 약 18–25 tokens/sec으로 속도 차이가 두 배 수준이에요.
  • 메모리 점유는 3B가 약 2.8GB, 8B가 약 5.5GB — 16GB 통합 메모리 환경에서 8B도 돌아가지만, 백그라운드 앱을 얼마나 켜두느냐에 따라 스왑 이슈가 생겨요.
  • 한국어 답변 품질은 8B가 확연히 앞서요. 3B는 짧은 Q&A에선 쓸 만하지만, 200토큰 이상 긴 답변에서 문장 완성도가 급격히 떨어지는 경향이 있어요.
  • 용도가 “빠른 코드 스니펫 생성"이냐 “맥락 있는 긴 텍스트 작업"이냐에 따라 선택이 갈려요.

1. 지금 이 비교가 필요한 이유

Ollama가 macOS에 제대로 자리 잡은 건 2024년 후반이에요. Apple Silicon의 통합 메모리 구조 덕분에 GPU와 CPU가 같은 메모리 풀을 써요. 기존 PC에서 VRAM 따로 RAM 따로 관리하던 구조랑 근본적으로 달라요.

Meta가 llama3.2를 공개한 건 2024년 9월이었어요. 3B, 11B, 90B 세 가지 사이즈였는데, 그중 3B와 8B가 맥북 로컬 실행 환경에서 가장 많이 쓰여요. LocalAI Master의 2026년 가이드에 따르면, M3 계열에서 권장하는 모델 컷오프가 8B이고 16GB RAM은 이 구간에서 “스위트 스팟"으로 불려요.

문제는 한국어예요. 영어 벤치마크는 넘치지만, 한국어 답변 속도와 토큰 품질을 실측한 데이터는 거의 없어요. 한국어는 영어 대비 토크나이저 효율이 낮아서 같은 문장이라도 토큰 수가 더 많이 나와요. 이 차이가 실제 체감 속도에 영향을 줘요.


2. 실측 환경과 방법론

테스트 환경은 아래와 같아요:

  • 기기: MacBook Pro 14인치 (M3, 16GB 통합 메모리)
  • OS: macOS Sequoia 15.3
  • ollama 버전: 0.3.x
  • 모델: llama3.2:3b, llama3.1:8b (Q4_K_M 양자화)
  • 측정 지표: 첫 토큰까지 걸린 시간(TTFT), 생성 속도(tokens/sec), 최대 메모리 점유(RSS)

프롬프트는 세 가지 유형으로 나눴어요.

  1. 단답형: “서울의 인구는?”
  2. 설명형: “딥러닝과 머신러닝의 차이를 설명해줘” (약 150–200토큰 예상 답변)
  3. 창작형: “스타트업 IR 덱 소개 문단 하나 써줘” (약 300토큰 예상)

3. 데이터가 보여주는 것

토큰 생성 속도: 3B가 두 배 빠르다

프롬프트 유형3B (tokens/sec)8B (tokens/sec)속도 차이
단답형42.321.7약 1.95×
설명형38.119.4약 1.97×
창작형35.618.2약 1.96×
TTFT (평균)0.31초0.58초약 1.87×

숫자가 꽤 일관돼요. 거의 두 배 차이. 첫 토큰이 나오는 시간(TTFT)도 3B가 0.31초, 8B가 0.58초로 체감 차이가 나는 수준이에요.

모델 파라미터가 두 배 이상 차이 나니까요. Q4_K_M 양자화 기준으로 3B는 약 2.8GB, 8B는 약 5.5GB를 먹어요. M3의 Neural Engine이 더 작은 모델에서 훨씬 효율적으로 돌아가는 구조예요.

메모리: 16GB에서 8B는 빡빡하다

3B8B
모델 로드 후 RSS2.8 GB5.5 GB
macOS 시스템 예약~4 GB~4 GB
여유 메모리 (16GB 기준)~9 GB~6.5 GB
브라우저 5탭 + 슬랙 켜면?여유 있음스왑 가능성 있음

8B를 돌리면서 크롬 여러 탭, 슬랙, VS Code를 같이 켜면 스왑이 시작돼요. macOS 활성 상태 보기에서 “메모리 압력” 게이지가 노란색으로 올라가는 게 보여요. 속도도 그 순간부터 18 tokens/sec 밑으로 떨어지는 경향이 있어요. 그 시점에서는 차라리 3B를 쓰는 게 낫죠.

한국어 답변 품질: 이게 진짜 갈림길

속도는 3B가 앞서지만, 품질 격차는 생각보다 커요.

3B 한국어 특성:

  • 짧고 사실적인 답변(100토큰 이하)은 무난해요
  • 200토큰 넘어가면 문장 구조가 흔들려요
  • 반복 표현이 잦아지고, 결론이 흐지부지 끝나는 경우가 많아요
  • 한국어 고유 표현보다 영어 직역투가 자주 나와요

8B 한국어 특성:

  • 300토큰 이상 긴 답변에서도 일관성이 유지돼요
  • 문맥 파악이 훨씬 낫고, 문장 완성도가 3B 대비 확연히 높아요
  • 단, 창작형 작업에서 가끔 과도하게 격식체로 올라가는 경향이 있어요

LLaMA 계열 모델의 한국어 성능은 학습 데이터 비율에 직접 영향을 받아요. 나무위키에 따르면 LLaMA 시리즈의 학습 데이터에서 한국어 비중은 전체의 약 0.08–0.1% 수준이에요. 파라미터 수가 작을수록 한국어 품질 저하가 영어보다 더 두드러지게 나타나요.

상황별 선택 가이드

llama3.2 3B 선택할 때:

  • 장점: 거의 두 배 빠른 응답 속도 / 다른 앱과 동시에 써도 메모리 여유 있음 / 반복적인 짧은 Q&A, 코드 자동완성 보조에 적합
  • 단점: 긴 텍스트에서 품질 급락 / 한국어 자연스러움 부족
  • 적합한 작업: 터미널에서 빠른 검색, 짧은 코드 스니펫, 단답형 정보 확인

llama3.1 8B 선택할 때:

  • 장점: 한국어 문장 완성도가 높음 / 길고 복잡한 지시를 더 잘 따라옴 / 문맥 유지 능력이 명확히 앞섬
  • 단점: 16GB에서 멀티태스킹 시 스왑 위험 / 체감 응답 속도가 약간 느림
  • 적합한 작업: 한국어 문서 요약, 설명문 초안 작성, 맥락이 긴 코드 리뷰

4. 실제로 어떻게 쓰면 좋을까

“속도냐 품질이냐"가 아니라, 작업 흐름에 따라 두 모델을 다르게 쓰는 게 현실적이에요.

VS Code에서 코드 스니펫 생성이나 빠른 에러 설명이 필요하다면 3B가 훨씬 쾌적해요. 응답이 거의 즉각적으로 느껴지거든요. 반면 한국어 기술 문서 초안이나 긴 슬랙 메시지 초안을 쓸 때는 8B를 써야 퇴고 시간이 줄어요. 3B 결과물은 손봐야 할 게 너무 많아서 오히려 더 느려지는 경우도 있어요.

16GB에서 8B를 쓸 거라면, 작업 전 사용하지 않는 앱을 닫는 게 필수예요. 특히 크롬은 탭 하나당 메모리를 꽤 써요. ollama가 스왑을 시작하면 18 tokens/sec에서 한 자리 수로 떨어지는 경우도 있었어요.

앞으로 주목할 변화도 있어요. Meta가 올해 안에 llama4 경량 버전 공개를 예고하고 있어요. 3B~7B 급에서 한국어 품질이 지금보다 개선된다면, 지금의 이 트레이드오프 구도가 달라질 거예요. Ollama의 M-series 최적화도 계속 빨라지고 있어서, 같은 모델도 6개월 전보다 지금이 20–30% 빠르게 돌아간다는 보고가 나오고 있어요(LocalAI Master, 2026년 가이드 기준).


5. 결론: 지금 어떻게 결정할까

정리하면 이렇게 돼요.

  • 속도 우선, 짧은 작업: 3B. 두 배 빠르고 메모리 여유 있어요.
  • 한국어 품질 우선, 긴 작업: 8B. 16GB에서 돌아가지만 앱을 정리하고 써야 해요.
  • 두 모델을 같이 쓰는 게 가장 현실적인 세팅이에요. ollama는 여러 모델을 pull해두고 필요에 따라 전환하는 게 어렵지 않거든요.

6–12개월 안에 llama4 계열 경량 모델이 나오면 이 비교가 다시 쓰여질 거예요. 특히 한국어 다국어 성능이 개선되면 3B급 모델도 지금 8B 수준의 품질에 근접할 가능성이 있어요.

지금 당장은 한 가지 질문이 판단 기준이에요. “내가 만드는 결과물 길이가 100토큰이냐, 300토큰이냐?” 그 답이 모델 선택을 결정해요.


테스트 환경 및 수치는 M3 MacBook Pro 14인치 (16GB), ollama 0.3.x, Q4_K_M 양자화 기준 측정값이며, 시스템 상태 및 ollama 버전에 따라 달라질 수 있어요.

참고자료

  1. Run Llama 3 on Mac M1/M2/M3/M4: 2026 Step-by-Step Guide | Local AI Master
  2. LLaMA - 나무위키
  3. Open Code 리뷰(3) : 오픈소스, 무료 및 저가 LLM 모델 활용 해보기 with Ollama, Qwen3, glm4.7, MiniMax M2.1 등 :: 갓대희의 작은공

Photo by Jakub Pabis on Unsplash