omlx jundot
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
- Lenguaje principal
- Python
- Stars
- 18,882
- Forks
- 1,642
Etiquetas
- Servidor de inferencia
- LLM
- Apple Silicon
- Caché de KV
- Aplicación de escritorio
- API
- Despliegue local
- CLI
Resumen
oMLX es un servidor de inferencia LLM optimizado para Apple Silicon con procesamiento por lotes continuo y caché jerárquica de KV (RAM + SSD) que permite reutilizar el contexto histórico entre peticiones. Se gestiona desde la barra de menú de macOS, ofrece API compatible con OpenAI y Anthropic, sop…
README
<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…