omlx jundot

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

主要言語
Python
Stars
18,882
Forks
1,642

タグ

  • ウェブアプリ
  • CLIツール
  • デスクトップアプリ
  • ローカルAI
  • ツール呼び出し
  • コンテキストプロトコルMCP
  • モデル管理

概要

Apple Silicon専用に最適化されたLLM推論サーバーで、メニューバーアプリから直接管理できる。連続バッチングと階層型KVキャッシュ(ホットRAM+コールドSSD)を備え、コンテキストの永続化と再利用を実現。LLM/VLM/OCR/エンベディング/リランカーを同時にサービスし、OpenAI/Anthropic API互換でClaude Codeなどと統合できる。

README

<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…

查看完整页面