omlx jundot
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
- 主要言語
- Python
- Stars
- 18,882
- Forks
- 1,642
タグ
- ウェブアプリ
- CLIツール
- デスクトップアプリ
- ローカルAI
- ツール呼び出し
- コンテキストプロトコルMCP
- モデル管理
概要
Apple Silicon専用に最適化されたLLM推論サーバーで、メニューバーアプリから直接管理できる。連続バッチングと階層型KVキャッシュ(ホットRAM+コールドSSD)を備え、コンテキストの永続化と再利用を実現。LLM/VLM/OCR/エンベディング/リランカーを同時にサービスし、OpenAI/Anthropic API互換でClaude Codeなどと統合できる。
README
<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…