omlx jundot
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
- Hauptsprache
- Python
- Stars
- 18,882
- Forks
- 1,642
Tags
- CLI-Tool
- Desptop-App
- LLM-Inferenz
- macOS
- Lokale KI
- MCP
- Tool-Aufruf
- Backend
Zusammenfassung
oMLX ist ein LLM-Inferenzserver, der für Apple Silicon optimiert ist und LLMs mit kontinuierlichem Batching sowie einer zweistufigen KV-Cache-Architektur (Hot-RAM + Cold-SSD) direkt vom macOS-Menüleisten-App verwaltet. Es löst das Problem der Speicher- und Kontrollbalance lokaler LLM-Server, indem …
README
<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…