TL;DR
- Apple 기기에서 로컬 대형 언어 모델(LLM)의 토큰 생성 속도는 메모리 대역폭과 모델 가중치 크기에 좌우되며, M5 Max에서 4비트 양자화된 70B 모델은 초당 약 13토큰을 생성함.
- 프롬프트 처리 속도는 그래픽 처리 장치(GPU)의 연산 성능에 좌우되며, M5·M6의 신경 가속기를 활용하는
MLX는 M4보다 3.5~4배 빠르게 프롬프트를 처리함. - 모델 가중치와 KV 캐시, 런타임 버퍼가 macOS에서 GPU에 허용하는 메모리 한도 안에 들어야 모델을 실행할 수 있음.
- 4비트 양자화는 16비트 모델보다 크기를 3.5배 줄이고 품질 손실은 적으며, 전문가 혼합(MoE) 모델은 전체 가중치가 메모리에 들어가도 토큰마다 일부 가중치만 읽음.
- 성능 추정치는 약 300건의 측정값을 바탕으로 하며 같은 소프트웨어에서 측정한 값과 대체로 15% 이내 차이를 보이고, 가격은 2026년 10월 1일 기준임.
작동 방식
- 생성 속도는 메모리 대역폭으로 결정됨
- 토큰을 하나 생성할 때마다 Mac은 모델의 활성 가중치를 모두 한 번씩 읽음. 따라서 토큰 생성 속도(디코드)는 대략 메모리 대역폭을 가중치 크기로 나눈 값임.
- M5 Max의 메모리 대역폭은 초당 614GB임. 4비트의 밀집형 70B 모델은 약 40GB이므로 초당 약 13토큰을 생성함.
- 시뮬레이터는 양자화 방식에 따라
MLX에서 대역폭의 75~87%를 사용하며,llama.cpp에서는 이보다 5%포인트 낮음. 여기에 칩과 모델 종류별로 측정한 토큰당 고정 비용이 더해짐. - 대화가 길어지면 새 토큰을 생성할 때마다 문맥에 대한 모델의 기억인 KV 캐시도 읽어야 하므로 속도가 느려짐.
- 프롬프트 처리 속도는 GPU로 결정됨
- 답변 전에 모델이 프롬프트를 읽는 단계인 프리필(prefill)은 연산 성능에 제한됨. 활성 파라미터와 토큰마다 약 2회의 연산이 필요하며, 여기에 프롬프트 길이의 제곱에 따라 늘어나는 어텐션 연산이 더해짐.
- M5와 M6 칩은 GPU 코어마다 신경 가속기를 탑재함.
MLX는 macOS 26.2 이상에서 이를 사용해 M4보다 프롬프트를 3.5~4배 빠르게 읽음. llama.cpp는 2026년 4월부터 행렬 곱 연산에 신경 가속기를 사용하지만, 어텐션에는 아직 사용하지 않음.
모델이 들어갈 수 있는 조건
- 모델 가중치, KV 캐시, 런타임 버퍼가 macOS가 GPU 사용을 허용하는 메모리 안에 모두 들어가야 함.
- macOS 26 및 27에서 GPU 사용 가능 메모리 비율은 다음과 같음.
- 16GB 또는 24GB 메모리: 74%
- 32~48GB: 78%
- 64GB 또는 96GB: 81%
- 128GB: 84%
- 256GB: 87%
- 512GB: 464GB
sudo sysctl iogpu.wired_limit_mb명령으로 다음 재시작 전까지 이 한도를 높일 수 있음.- Apple의 메모리 용량 표기는 이진 단위임. 따라서 16GB는 172억 바이트에 해당함. 여기서 모델 크기는 Hugging Face와 마찬가지로 십억 바이트 단위임.
양자화와 전문가 혼합
- 양자화는 각 가중치를 더 적은 비트로 저장하는 방식임. 일반적으로 선택되는 4비트 모델은 16비트 모델보다 3.5배 작으면서 품질 손실은 적음.
- 8비트는 거의 손실이 없으며, 대체로 4비트의 더 큰 모델이 8비트의 더 작은 모델보다 성능이 좋음.
gpt-oss,Qwen3.6 35B A3B,DeepSeek같은 전문가 혼합(MoE) 모델은 토큰마다 전문가 일부만 사용함.- 가중치 전체는 메모리에 들어가야 하지만, 토큰마다 읽는 것은 활성 가중치뿐임.
gpt-oss 120B는 65GB가 필요하며, 토큰 생성 속도는 5B 모델과 비슷함.
수치의 신뢰도
- 추정에 사용한 상수는
llama.cpp벤치마크 스레드,MLX및oMLX결과, Apple 자체 수치, M5·M6 Mac 리뷰 등 공개된 측정값 약 300건에서 가져옴. - 같은 소프트웨어에서 측정한 수치와 비교하면 추정치는 대체로 15% 이내임.
- 실제 속도는 앱, 앱 버전, 설정에 따라 달라짐.
Ollama,LM Studio,llama.cpp는 모두 같은 엔진을 사용하지 않음. - 가격은 선택한 통화 기준 Apple Store 가격이며, 기준일은 2026년 10월 1일이고 기본 저장 용량을 기준으로 함.
- Apple은 2026년 6월 25일 가격을 인상함. 프랑스에서 판매되는 MacBook과 영국에서 판매되는 MacBook Air 및 Pro에는 전원 어댑터가 포함되지 않음.
- 512GB Mac Studio는 2026년 10월 말 출하 예정이며, 가격은 아직 공개되지 않음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요