AI

맥북 M5 로컬 AI 속도 llama.cpp보다 6배 빠르다는데 일반인이 느낄 차이 있나: 모델 크기별 비교

맥북 M5 로컬 AI 속도 llama.cpp보다 6배 빠르다는데 일반인이 느낄 차이 있나: 모델 크기별 비교

로컬 AI 쓰려고 세팅하다가 멈춘 적 있죠? “근데 이게 진짜 빠른 건가?” 싶어서요.

M5 Max + MLX가 이겨요. 70B 대형 모델 기준으로는 확실하게. 하지만 7B~13B 소형 모델만 쓴다면 RTX 4090 빌드가 더 빠르고, 예산도 절반 이하예요.

TL;DR

  • MLX (M5 Max) 쓰세요 if: 70B 이상 대형 모델을 로컬에서 돌리고 싶거나, 전력 요금이 걱정되거나, 파인튜닝 없이 추론만 할 때
  • llama.cpp + RTX 4090 쓰세요 if: 7B~13B 모델 속도가 최우선이거나, Stable Diffusion·LoRA 파인튜닝까지 같이 쓸 때
  • 둘 다 건너뛰세요 if: 예산이 800달러 이하라면 — RTX 4070 Ti 빌드가 소형 모델에선 M5 Pro를 이기거든요

이 글에서 비교할 항목:

  • 추론 속도: 토큰/초, 모델 크기별 차이
  • 실제 체감: 일반인 기준 “느껴지는” 차이가 있는지
  • 비용: 초기 구입비 + 월 전기료
  • 한계: 각각 어디서 무너지는지

두 플레이어 소개

**MLX (Apple Silicon M5 Max)**는 Apple이 2024년 공개한 머신러닝 프레임워크예요. M5 Max 탑재 맥북 프로 16인치는 2026년 5월 기준 3,499달러(64GB)부터 시작하고, 128GB 구성은 4,499달러예요. 핵심 강점은 유니파이드 메모리예요. GPU VRAM과 RAM이 분리된 게 아니라 하나의 풀을 공유하는 구조라서, RTX 4090의 24GB 한계와 달리 128GB 전체를 모델에 쏟아부을 수 있어요. Apple Silicon M5 로컬 LLM 벤치마크에 따르면 M5 Max 128GB에서 Llama 3.3 70B Q4 모델이 12~18 토큰/초를 기록했어요.

llama.cpp는 Georgi Gerganov가 만든 C++ 추론 엔진이에요. 원래 CPU에서 LLM 돌리려고 시작했지만, 지금은 CUDA(NVIDIA GPU)와 Metal(Apple GPU) 모두 지원하는 사실상의 표준 로컬 AI 백엔드로 자리 잡았어요. RTX 4090 기준 7B 모델은 90120 토큰/초, 70B 모델은 610 토큰/초예요. 2026년 초 기준 GitHub 커밋 수가 월 500건을 넘을 만큼 활발하고, 하드웨어 비용은 RTX 4090 단독 빌드 기준 1,600~2,000달러 수준이에요.


항목별 정면 비교

항목MLX (M5 Max 128GB)llama.cpp + RTX 4090승자
진입 비용4,499달러1,600~2,000달러RTX 4090
70B 모델 추론 속도12~18 토큰/초6~10 토큰/초MLX
7B 모델 추론 속도50~75 토큰/초90~120 토큰/초RTX 4090
최대 모델 크기 (단일 GPU)128GB (Q8까지 가능)24GB (70B Q5+ 불가)MLX
월 전기료8~12달러40~60달러MLX
파인튜닝 지원제한적 (LoRA 일부)CUDA 완전 지원RTX 4090
장시간 연속 추론3시간 후 쓰로틀링24시간+ 안정RTX 4090

Apple Silicon M5 벤치마크 데이터 출처

가장 눈에 띄는 행은 70B 모델 속도예요. RTX 4090은 24GB VRAM으로 70B 모델을 절반 이상 RAM으로 오프로딩해야 해요. 그 병목이 추론 속도를 610 토큰/초로 끌어내리죠. 반면 M5 Max는 460614 GB/s 메모리 대역폭으로 모델 전체를 통합 메모리에 올려놓기 때문에 두 배 가까이 빨라요.

전기료 차이는 진짜 돈 얘기예요. RTX 4090은 추론 시 350W를 먹어요. M5 Max는 65100W. 하루 8시간씩 돌리면 RTX 4090은 월 4060달러, M5 Max는 8~12달러예요. 1년이면 거의 40만 원 차이가 나요.

그럼 “6배 빠르다"는 주장은 어디서 나온 걸까요? Ollama가 M5에서 MLX 백엔드를 자동으로 켜면서 나온 비교예요. 정확히는 llama.cpp Metal 백엔드 대비 순수 MLX가 510% 더 빠른 정도예요. 70B 모델에서 llama.cpp의 CPU 오프로딩 페널티까지 포함하면 23배 차이가 나고, 6배는 CPU만 쓰는 llama.cpp vs. MLX라는 특정 조건에서 나오는 숫자예요. 일반 사용자 기준으로 “6배"를 그대로 믿으면 과장이에요.


각각 어디서 무너지나

MLX (M5 Max)가 무너지는 시점: 맥북 프로에서 3시간 이상 연속 추론을 돌리면 발열 쓰로틀링이 시작돼요. GitHub 이슈(MLX 레포 #847)에서 장시간 배치 처리 시 토큰 속도가 30% 이상 떨어진다는 보고가 여러 건 올라와 있어요. 서버처럼 24시간 API를 돌려야 한다면 맥북 프로는 답이 아니에요. Mac Studio M5가 2026년 10월 출시 예정이지만, 아직은 검증된 데이터가 없어요.

llama.cpp + RTX 4090이 무너지는 시점: 70B Q5 이상 모델을 단일 GPU로 돌리는 게 물리적으로 불가능해요. VRAM 24GB 한계를 넘으면 CPU RAM으로 오프로딩해야 하는데, 이때 속도가 6~10 토큰/초로 떨어지고 시스템 RAM도 64GB 이상 필요해요. 멀티 GPU 세팅은 비용이 두 배 이상 올라가고, 70B 이상 모델을 쓰고 싶다면 사실상 막힌 길이에요.


결론: 일반인이 실제로 느끼는 차이

70B 모델 쓰는 사람이라면 차이가 느껴져요. 1218 토큰/초 vs. 610 토큰/초는 긴 답변 생성 시 대략 30~40초 차이예요. 채팅보다 문서 요약이나 코드 리뷰처럼 긴 출력을 기다릴 때 체감이 확실하게 나와요.

7B~13B 모델만 쓴다면 RTX 4090이 더 빠르고, M5 Max는 비교 자체가 안 돼요. 90~120 토큰/초는 텍스트가 거의 실시간으로 나오는 속도거든요.

지금 당장 해볼 수 있는 것: PromptQuorum 벤치마크 페이지에서 본인이 쓰려는 모델 크기를 확인하고, 해당 모델 기준 토큰/초를 비교해보세요. 10분이면 자신에게 맞는 쪽을 정할 수 있어요.

앞으로 지켜봐야 할 질문은 하나예요. 2026년 10월 Mac Studio M5 출시 후 장시간 쓰로틀링 문제가 해결되면, 서버용 로컬 AI 인프라도 Apple Silicon으로 옮겨갈까요? 그 시점이 llama.cpp + NVIDIA 조합의 진짜 변곡점이 될 거예요.

참고자료

  1. 2026년 초보자 로컬 LLM: Llama, Phi, Gemma, Qwen | PromptQuorum
  2. Best Apple M5 Pro and Max for Local AI (2026) | InsiderLLM
  3. llama.cpp Tutorial: Run a Local LLM in 12 Steps [2026]

Photo by Igor Omilaev on Unsplash