로컬 추론 엔진 Magnitude는 내 컴퓨터에 맞춰 커널을 새로 컴파일해 llama.cpp보다 최대 2배 빠르다
X 첫 글 20시간 전@Dontgiveup_26 ♥ 823
Ollama와 llama.cpp를 쓰던 로컬 AI 개발자들 사이에서 Magnitude라는 오픈소스 추론 엔진이 화제다. 보통 엔진은 Apple Silicon용, NVIDIA용처럼 하드웨어 종류별로 미리 컴파일한 커널을 쓰는데, Magnitude는 첫 실행 전에 내 칩에 맞춰 커널을 컴파일하고 튜닝한다. 그 결과 llama.cpp보다 최대 2배 빠르다고 하며, Metal에서는 디코딩이 92%, CUDA에서는 19% 빨랐다고 한다. Apple Silicon과 NVIDIA, AMD, CPU만 있는 환경에서도 돈다.
Rust로 짰고, 쓰던 코딩 에이전트(Pi, OpenCode, Hermes, Codex 등)를 한 번 눌러 연결한다. 한국어로 소개한 글에는 좋아요가 8백 개 붙었다.