TL;DR

  • Magnitude는 Apple Silicon, NVIDIA, AMD 또는 CPU에서 오픈 모델을 실행할 때 커널을 기기에 맞춰 컴파일하고 튜닝해 llama.cpp보다 최대 2배 빠르게 구동하는 오픈소스 추론 엔진임.
  • Metal에서 디코드 속도 92%, CUDA에서 19% 향상됐으며, 에이전트당 메모리를 27% 적게 사용함.
  • 인기 오픈 가중치 모델 계열을 위한 수작업 최적화 커널과 동시 세션용 프리픽스 캐시를 제공함.
  • 데스크톱 앱에서 모델을 내려받고 Pi, OpenCode, Hermes, Codex 등 에이전트를 한 번의 클릭으로 연결할 수 있음.
  • macOS, Linux, Windows를 지원하며, 프롬프트·파일·모델이 기기에 머무는 무료 오픈소스 소프트웨어임.

Magnitude 소개

  • Magnitude는 사용하는 하드웨어에 맞춰 자체 최적화되는 에이전트용 오픈소스 추론 엔진임.
  • 데스크톱 앱으로 제공되며, 오픈 모델을 실행하고 기존에 사용하는 에이전트와 연결함.
  • 기기에서 커널을 컴파일하고 튜닝해 오픈 모델을 llama.cpp보다 최대 2배 빠르게 실행함.
  • Apple Silicon, NVIDIA, AMD GPU뿐 아니라 CPU만으로도 작동하며, 고정된 최소 하드웨어 사양은 없음.
  • 다운로드: macOS, Windows, Linux용 Magnitude.

시작하기

  • Magnitude를 내려받아 설치한 뒤 앱을 엶.
  • Discover에서 추천 모델을 선택해 내려받음.
  • Connections에서 에이전트를 연결해 사용을 시작함.
  • 데스크톱 앱에 Magnitude CLI가 포함되어 있어 별도 설치가 필요하지 않음.

주요 기능

  • llama.cpp 대비 최대 2배 빠른 속도를 제공하며, Metal에서 디코드 속도 92%, CUDA에서 19% 향상됨.
  • 모델을 실행하기 전에 실제 기기의 하드웨어에서 커널을 튜닝함.
  • 인기 오픈 가중치 모델 계열을 위한 수작업 최적화 커널을 제공함.
  • 에이전트당 메모리 사용량이 27% 적고, 에이전트가 멈추면 메모리를 해제함.
  • 동시 세션이 프리픽스 캐시를 공유해 속도 저하를 방지함.
  • Pi, OpenCode, Hermes, Codex 등 사용하는 에이전트와 한 번의 클릭으로 연결함.
  • 토큰 비용이 없고, 데이터가 기기 밖으로 나가지 않는 Apache 2.0 라이선스 오픈소스 소프트웨어임.

자주 묻는 질문

  • llama.cpp, Ollama, LM Studio보다 빠른 이유: 이들 도구는 다양한 하드웨어 유형을 대상으로 미리 컴파일된 커널을 제공하는 반면, Magnitude는 모델 실행 전에 실제 기기에서 커널을 컴파일하고 튜닝해 해당 칩에 맞춤. llama.cpp와의 벤치마크는 비교 자료에서 확인 가능함.
  • 필요한 하드웨어: Apple Silicon, NVIDIA 또는 AMD GPU, 혹은 CPU만으로도 작동함. 소형 기기에서는 작은 모델을 실행하고, 메모리가 많을수록 큰 모델을 실행할 수 있음.
  • 지원 운영체제: macOS, Linux, Windows임.
  • 지원 모델: 전체 목록은 magnitude.dev/models에서 확인 가능함. 널리 사용되는 오픈 가중치 모델 계열을 대상으로 최적화 커널을 작성함.
  • 지원 에이전트: Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline을 한 번의 클릭으로 연결함. 그 밖의 에이전트는 OpenAI 호환 API를 통해 사용할 수 있음.
  • 개인정보 보호: 프롬프트, 파일, 모델은 기기에 머무름. 모델을 내려받은 뒤에는 인터넷 연결이 필요하지 않음.