맥미니 로컬 LLM 어디까지 될까? 2026년 M6·M5 Pro 메모리별 모델 선택 기준

  • Post last modified:2026년 09월 11일
  • Post category:기술

2026년 8월 25일 발표된 신형 맥미니(M6·M5 Pro, 9월 22일 출시·현재 사전 주문 중)로 로컬 LLM을 돌리려면 메모리 구성이 곧 선택 가능한 모델의 범위다. 결론부터 정리하면 M6 16GB는 9B급 Q4 양자화 모델까지, M6 24~32GB는 14B~30B급까지, M5 Pro 48GB는 35B급, M5 Pro 64GB는 70B급 Q4까지 현실적으로 돌릴 수 있다. 기준은 Apple 한국 공식 스펙의 메모리 구성과 Ollama 공식 라이브러리의 실제 모델 다운로드 크기이며, 통합 메모리 전체를 모델에 쓸 수는 없다는 점을 계산에 넣어야 한다.

핵심 요약

  • M6 16GB(₩1,499,000부터): qwen3.5:9b·gemma4:12b급까지 여유 있게 실행한다.
  • M6 24~32GB: gemma4:26b·qwen3:30b급까지 들어간다. 32GB가 30B급 Q4의 현실적인 최저선이다.
  • M5 Pro 48GB: qwen3.6:35b에 KV 캐시 여유까지 확보된다.
  • M5 Pro 64GB: llama3.1:70b Q4가 목표라면 사실상 유일한 맥미니 선택지다.
  • 공통 규칙: 통합 메모리 전체를 쓸 수 없으니 약 70% 상한으로 계산하고, Ollama의 VRAM별 컨텍스트 기본값(24GiB 미만 4k·24~48GiB 32k·48GiB 이상 256k)을 반영한다.
맥미니 2026 메모리 구성별 로컬 LLM 가용 용량 근사와 대표 모델 크기 비교 그래프
맥미니 2026 메모리 구성별 모델 가중치 가용 용량 근사와 대표 모델 크기
출처: Apple KR 제품 사양·Ollama 라이브러리 기반 계산

2026년 맥미니 라인업이 바뀌었다

2026년 8월 25일 발표 모델(모델명 A3534·A3535, 9월 22일 출시)부터 칩 구성이 M6와 M5 Pro 두 축으로 정리됐다. 기존 “M4 맥미니 가이드”를 그대로 따르면 메모리 옵션과 가격을 잘못 계산하게 된다. 아래 표의 가격은 2026년 9월 11일 Apple KR 공식 스토어 기준이며, 신형은 현재 사전 주문 단계다.

CPU/GPU메모리 기본추가 구성메모리 대역폭시작 가격
M612코어/12코어16GB24GB·32GB153GB/s(24·32GB는 170GB/s)₩1,499,000
M5 Pro15코어/16코어24GB48GB·64GB307GB/s₩2,990,000
M5 Pro(상위)18코어/20코어24GB48GB·64GB307GB/s₩3,330,000

로컬 LLM 관점에서 중요한 변수는 코어 수가 아니라 메모리 용량과 대역폭이다. 토큰 생성 속도는 메모리 대역폭에 비례하는 경향이 있어, 307GB/s인 M5 Pro가 장문 생성에서 유리하다. M6의 12코어 GPU는 소형 모델의 프리필(prefill) 속도에 기여하지만, 큰 모델을 돌리는 한계는 대역폭이 정한다.

통합 메모리는 전부 모델에 쓸 수 없다

맥미니의 통합 메모리는 CPU와 GPU가 공유한다. Ollama가 Metal로 GPU 가속을 쓰더라도 macOS 시스템, 창 관리자, 런타임이 이미 일정량을 점유하며, GPU가 한 번에 다룰 수 있는 작업 세트도 전체 메모리보다 작다. 그래서 “32GB니까 32GB 모델을 돌린다”는 계산은 성립하지 않는다.

실무에서는 다음 세 항을 더해 모델 크기를 정한다.

  1. 모델 가중치: Ollama 기준 Q4 양자화 기본 태그의 다운로드 크기.
  2. KV 캐시: 컨텍스트 길이에 비례해 추가로 필요한 메모리. 컨텍스트를 늘리면 그만큼 가용 용량이 줄어든다.
  3. 여유분: 시스템 점유와 런타임 오버헤드. 통합 메모리의 약 70%를 모델 총량 상한으로 잡으면 실패가 적다.

Ollama는 모델 실행 후 ollama ps로 실제 점유 크기와 PROCESSOR(100% GPU 여부), CONTEXT(할당된 컨텍스트)를 확인할 수 있다. 100% GPU가 아니라면 가중치 일부가 CPU로 오프로딩된 상태라 속도가 크게 떨어진다.

메모리 구성별 실행 가능 모델 실제 크기

Ollama 공식 라이브러리의 Q4 계열 기본 태그 크기를 기준으로 정리한다. 크기는 다운로드 용량이며 실행 시 KV 캐시가 추가된다.

모델크기16GB24GB32GB48GB64GB
qwen3.5:9b6.6GB가능여유여유여유여유
gemma4:12b7.6GB가능여유여유여유여유
qwen3:14b9.3GB짧은 컨텍스트가능여유여유여유
gpt-oss:20b14GB불가가능가능여유여유
gemma4:26b19GB불가한계선가능여유여유
qwen3.6:35b23GB불가불가한계선가능여유
llama3.1:70b43GB불가불가불가불가(스왑)가능

“한계선”은 실행은 되지만 긴 컨텍스트나 동시 요청에서 스왑·종료가 발생할 수 있는 구간이다. 여유 있는 구간에서도 에이전트·코딩처럼 컨텍스트를 많이 쓰는 작업은 KV 캐시 증가를 감안해 한 단계 작은 모델을 선택하는 편이 안전하다.

컨텍스트 기본값이 바뀐 점을 반영한다

Ollama는 VRAM 크기에 따라 기본 컨텍스트 길이를 자동으로 정한다. 공식 문서 기준 24GiB 미만이면 4k, 24~48GiB면 32k, 48GiB 이상이면 256k다. 웹 검색·에이전트·코딩 도구 연동처럼 긴 컨텍스트가 필요한 작업은 64,000 토큰 이상을 권장하므로 환경 변수로 직접 지정한다.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

컨텍스트를 늘리면 그만큼 KV 캐시 메모리가 커진다. 32GB 구성에서 30B급 모델을 64k 컨텍스트로 돌리는 조합은 가중치만으로도 23GB에 근접하므로 실행이 보장되지 않는다. 컨텍스트 요구가 큰 작업일수록 모델 크기를 한 단계 낮추는 것이 맥미니에서 실패하지 않는 선택이다.

용도별 추천 조합

용도추천 구성추천 모델근거
챗봇·요약 맛보기M6 16GBqwen3.5:9b, gemma4:12b6.6~7.6GB로 여유, 진입 가격 최저
개인 어시스턴트·RAGM6 24GBqwen3:14b + 8k 컨텍스트가중치 9.3GB 후 KV 캐시 여유
코딩 보조M6 32GBqwen3-coder:30b(19GB) 또는 gpt-oss:20b긴 컨텍스트 감안해도 실행 여유
로컬 에이전트 서버M5 Pro 48GBqwen3.6:35b(23GB) + 32k 컨텍스트기본 32k 컨텍스트 구간 진입
70B급 품질 필요M5 Pro 64GBllama3.1:70b(43GB) Q464GB에서만 현실적 실행

MLX 변형 태그(예: gemma4:e2b-mlx, qwen3.6:27b-mlx)는 Apple Silicon 최적화 빌드로, 동일 크기급에서 속도 이점을 볼 수 있는 경우가 있다. Ollama로 ollama run gemma4:e2b-mlx처럼 바로 실행할 수 있으니 M6·M5 Pro 환경이라면 기본 태그와 비교해서 선택한다.

구매 전 확인 체크리스트

  1. 돌릴 모델의 크기를 Ollama 라이브러리에서 먼저 확인한다. 파라미터 수가 아니라 다운로드 크기가 기준이다.
  2. 컨텍스트 요구를 정한다. 챗봇은 4k~8k, 코딩·에이전트는 32k 이상으로 가정한다.
  3. 모델 가중치 + KV 캐시가 통합 메모리의 70% 이내로 들어오는지 계산한다.
  4. 장기 운영이면 저장 장치도 함께 정한다. 모델 2~3개만 보관해도 50GB를 넘는다.
  5. 실행 후 ollama psPROCESSOR100% GPU인지, CONTEXT가 의도한 값인지 확인한다.
  6. 동시 요청이 필요하면 모델 하나당 점유가 곱해진다는 점을 반영해 메모리를 한 단계 올린다.

함께 읽으면 좋은 글

FAQ

M6 16GB로 로컬 LLM은 어디까지 현실적인가?

qwen3.5:9b(6.6GB)·gemma4:12b(7.6GB)급이 기본값이고, qwen3:14b(9.3GB)는 컨텍스트를 4k~8k로 짧게 쓰면 실행 가능하다. 20B급 이상은 가중치부터 16GB 통합 메모리의 가용 범위를 넘으므로 다른 구성을 봐야 한다.

32GB와 48GB 중에서 고민된다. 무엇을 우선할까?

돌리려는 모델이 30B급 이하라면 M6 32GB로 충분하다. qwen3.6:35b(23GB)를 긴 컨텍스트로 쓰거나 에이전트 워크로드로 32k 컨텍스트 기본값이 필요하다면 M5 Pro 48GB가 실패가 적다. 대역폭(170GB/s vs 307GB/s) 차이도 생성 속도에 영향을 준다.

컨텍스트를 늘리면 메모리는 얼마나 더 필요한가?

KV 캐시 크기는 모델 구조(레이어 수·헤드 수)와 컨텍스트 길이에 비례해 커진다. 정확한 계산식은 로컬 LLM 메모리 계산법 글에서 다룬다. 실무 규칙으로는 컨텍스트를 4배로 늘리면 KV 캐시도 대략 4배로 커진다고 가정하고 여유를 잡는다.

기존 M4 맥미니 가이드를 그대로 따라도 되는가?

모델 크기 기준은 유효하지만 메모리 옵션·가격·컨텍스트 기본값이 바뀌었다. M4 16GB·24GB 체계와 달리 2026년 모델은 M6 16/24/32GB와 M5 Pro 24/48/64GB로 정리됐고, Ollama의 VRAM별 컨텍스트 기본값도 새로 반영해야 한다. 구매 결정은 이 글의 2026년 기준으로 다시 계산하는 편이 안전하다.

gpt-oss:120b는 맥미니로 불가능한가?

다운로드 크기 65GB로 64GB 구성조차 가중치부터 수용하지 못한다. 맥미니에서 120B급이 필요하다면 클라우드 API를 쓰거나 더 큰 통합 메모리를 가진 Mac(Studio·Pro 계열)을 봐야 한다.

참고 자료

답글 남기기