omlx jundot
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
- 主要语言
- Python
- Stars
- 18,882
- Forks
- 1,642
标签
- 推理优化
- 本地部署
- 桌面应用
- Python
- 工具调用
- 上下文协议MCP
- 模型管理
- 库/SDK
摘要
oMLX 是一个专为 Apple Silicon Mac 优化的 LLM 推理服务器,从 macOS 菜单栏直接管理,提供连续批处理和热/冷分层 KV 缓存,通过 SSD 持久化缓存避免重复计算。它支持 LLM、VLM、OCR、嵌入和重排序模型的多模型服务,兼容 OpenAI 与 Anthropic API,并内置管理后台、模型下载器、性能基准测试以及 Claude Code 等工具的集成配置。适用于在本地 Mac 上搭建高性能、可离线运行的多模型推理环境。
README
<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…