omlx jundot
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
- 주요 언어
- Python
- Stars
- 18,882
- Forks
- 1,642
태그
- 로컬 실행
- LLM 인퍼런스 서버
- Apple Silicon
- 멀티모달
- CLI도구
- 데스크톱 앱
- 벤치마크
- 추론 가속
요약
oMLX는 Apple Silicon(M1-M4)에서 최적화된 LLM 추론 서버로, 연속 배칭과 Hot(RAM)+Cold(SSD) 계층형 KV 캐시를 통해 효율적인 추론을 제공합니다. macOS 메뉴바 앱과 CLI를 통해 LLM/VLM/임베딩/리랭커 등 멀티 모델을 관리하고, OpenAI/Anthropic API를 완전 대체하며 Claude Code, Codex, Copilot 등과 통합됩니다. 관리자 대시보드에서 채팅, 모델 다운로드, 벤치마크, 모델별 설정을 지원하며 macOS 사용자에게 로컬 추론 서버 운영을 위한 원스톱 솔루…
README
<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…