TL;DR
- Apple Silicon Mac은 메모리 용량에 맞는 1B~70B 이상 모델을 로컬에서 실행할 수 있으며, 대부분은 새 하드웨어 없이도 시작 가능함.
- 1~3B 모델은 모든 Apple Silicon Mac에서, 7~8B 모델은 메모리 8GB에서, 14B 모델은 16GB에서, 70B 모델은 64GB 이상에서 편안하게 실행됨.
- 무료 도구인 Ollama와 LM Studio는 같은 오픈 모델을 실행하며, 선택 기준은 기능이 아니라 명령줄과 그래픽 인터페이스 중 어떤 방식을 선호하는지임.
- 로컬 모델은 어려운 추론과 긴 문서 생성에서 프런티어 클라우드 모델을 앞서지 않지만, 지연 시간·개인정보 보호·비용·안정성에서 이점이 있음.
- 로컬 AI의 일상 업무상 가치는 채팅보다 전사, 파일 검색, 자동완성처럼 평소 쓰는 도구에 모델이 내장되는 데 있음.
Mac이 로컬 AI에 특히 적합한 이유
- Apple Silicon은 CPU와 GPU가 하나의 메모리 풀을 공유하는 통합 메모리(unified memory) 구조이므로, PC 그래픽 카드 메모리에 들어가지 않는 모델도 Mac의 일반 메모리에서 실행 가능함.
- Neural Engine과 Apple의 MLX 프레임워크도 MacBook의 로컬 AI 접근성을 높이는 요소임.
- M6 Mac mini는 899달러부터 시작하며, Apple은 듀얼 16코어 Neural Engine과 메모리 대역폭을 AI 중심 기능으로 내세움. 관련 내용은 Apple just made the case for local AI에서 다룸.
- 최신 기기가 아니어도 시작 가능하며, 2020년 M1 MacBook Air도 7~8B 모델을 무리 없이 실행함.
기기별로 적합한 모델 크기
- 아래 모델 크기는 매개변수 수이며, 메모리 사용량은 4비트 양자화 버전의 대략적인 요구량임. 양자화 방식과 앱 오버헤드에 따라 달라질 수 있지만, 기기 선택을 위한 대략적인 기준임.
| 모델 크기 | 4비트 메모리 사용량(대략) | 편안한 실행 환경 |
|---|---:|---|
| 1~3B | 약 1~2GB | 모든 Apple Silicon Mac |
| 7~8B | 약 4~5GB | 8GB 이상 |
| 14B | 약 9GB | 16GB 이상 |
| 30B 이상 | 약 18~20GB | 32GB 이상 |
| 70B 이상 | 40GB 이상 | 64GB 이상 |
- 안전하게 실행하려면 두 가지 기준을 적용하면 됨.
- 모델이 5GB를 요구한다면 Chrome과 Slack도 실행 중인 8GB 기기에서 여유가 부족할 수 있으므로, 다른 앱을 닫거나 더 작은 모델을 선택해야 함.
- 실제 작업에서는 모델이 클수록 항상 나은 것은 아님. 특정 작업에 맞게 조정된 작은 모델이 범용 대형 모델보다 나을 수 있으며, 이는 TypeTab의 핵심 전제임.
도구별 특징
- Ollama는 명령줄 도구임.
ollama run llama3.2를 실행하면 터미널에서 로컬 모델과 대화할 수 있으며, 무료·오픈소스이고 간단해 개발자에게 적합한 사실상의 표준임. - LM Studio는 그래픽 인터페이스 도구임. 모델을 검색하고 내려받아 채팅할 수 있으며, 로컬 앱이 연결할 수 있는 OpenAI 호환 서버로도 실행 가능함. 개인 사용은 무료이며 터미널을 선호하지 않는 사람에게 적합함.
- 두 도구 모두 같은 오픈 모델을 실행하므로, 차이는 기능이 아니라 인터페이스임. MLX 네이티브 런타임과
llama.cpp를 직접 사용하는 방식도 있지만, 이 글의 독자 95%에게는 Ollama와 LM Studio가 적합함.
로컬 모델의 현실적인 한계
- 로컬 모델은 프런티어 모델과 같지 않음. 7~8B 모델은 어려운 추론, 긴 구조화 문서, 연구 성격의 작업에서 대형 클라우드 모델과 맞먹지 못함. 로컬 AI를 판매하는 입장에서도 이 점은 분명함.
- 로컬 모델이 제공하는 이점은 다음과 같음.
- 지연 시간: 왕복 통신이 없어 생성이 즉시 시작됨.
- 개인정보 보호: 데이터가 기기 밖으로 나가지 않아 초안, 코드, 미완성 생각이 서버에 전달되지 않음.
- 비용: 사용량에 따른 과금 없이 하루 종일 실행 가능함.
- 안정성: 사용량 제한이나 서비스 중단, 요금제 변경에 영향을 받지 않음.
- 적절한 역할 분담은 생각의 어려운 5%에 프런티어 모델을, 지속적으로 이뤄지는 타이핑의 95%에 로컬 모델을 사용하는 것임. 두 방식은 경쟁 관계가 아니며, 프런티어 구독을 이용하면서 로컬 모델도 하루 종일 실행하는 구성이 가능함.
잘 이야기되지 않는 활용 사례
- 로컬 모델을 채팅 창에서 사용하는 것은 가장 흥미로운 활용 방식이 아님. 가끔 말을 거는 모델은 손님에게 보여주는 장난감에 가깝지만, 일상 도구에 들어간 모델은 기반 시설에 가까움.
- 일상적인 활용 사례로 회의에서 작동하는 로컬 음성 전사, 개인 파일 대상 로컬 검색, 그리고 입력 중인 문장을 완성하는 로컬 자동완성이 있음.
- TypeTab은 1B 모델을 기기 안에서 사용자의 글에 맞게 미세 조정하고, Slack·Mail·브라우저에서 유령 텍스트 형태로 문장을 제안하는 제품임. 채팅 창이 아니라 도구에 얹히는 계층임.
- 문장 완성 모델은 사용자의 어휘를 학습해야 하며, 이를 위해 실제 초안을 학습 데이터로 사용해야 함. 따라서 모델은 초안이 있는 기기에서 실행되어야 하며, 이것이 이 기능을 클라우드 제품으로 제공할 수 없는 이유임. 작동 방식은 How TypeTab learns your writing style에서 확인 가능함.
- Ollama를 내려받아 로컬 모델과 대화하는 일은 재미있고 기술에 대한 막연함을 줄이는 데 유용함. 하지만 일상 업무에서 얻는 로컬 AI의 가치는 채팅보다 존재를 의식하지 않게 되는 모델에 있음.
자주 묻는 질문
- Mac에서 ChatGPT를 로컬로 실행할 수 있는가?
- ChatGPT 자체는 폐쇄형 클라우드 서비스이므로 로컬 실행이 불가능함. 다만 Llama, Mistral, Gemma 같은 오픈 모델은 Ollama나 LM Studio를 통해 모든 Apple Silicon Mac에서 로컬 실행 가능하며, 일상적인 용도의 상당 부분을 처리함.
- 채팅 품질의 추론에서는 프런티어 클라우드 모델이 여전히 앞서지만, 일상적인 타이핑 작업에서는 로컬 모델이 경쟁력을 갖추며 개인정보도 보호함.
- 로컬 LLM을 실행하려면 메모리가 얼마나 필요한가?
- 대략 4비트 양자화 기준으로 8GB는 7~8B 모델, 16GB는 14B 모델을 편안하게 실행하며, 70B급 모델에는 64GB 이상이 필요함. 1~3B 모델은 모든 Apple Silicon Mac에서 실행 가능함.
- 다른 앱을 위한 여유 메모리를 남겨야 함. 간신히 들어맞는 모델은 기기 전체를 느리게 만들 수 있음.
- Mac에서 로컬 모델을 실행할 때 가장 좋은 도구는 무엇인가?
- 터미널 사용에 익숙하다면
ollama run llama3.2로 바로 시작할 수 있는 Ollama가 적합하며, 모델 탐색기가 있는 그래픽 앱을 원한다면 LM Studio가 적합함. - 두 도구 모두 무료이며 같은 오픈 모델을 실행하므로 선택 기준은 기능이 아니라 인터페이스임.
- 로컬 모델은 ChatGPT만큼 성능이 좋은가?
- 어려운 추론과 긴 글 생성에서는 프런티어 클라우드 모델이 여전히 앞서므로 그렇지 않음.
- 지연 시간, 개인정보 보호, 비용, 자동완성·음성 전사 같은 특정 작업에서는 로컬 모델이 뚜렷한 이점을 제공함. 실용적인 구성은 어려운 5%에 클라우드 구독을, 지속적인 95%에 로컬 모델을 사용하는 방식임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요