omlx jundot

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

Lenguaje principal
Python
Stars
18,882
Forks
1,642

Etiquetas

  • Servidor de inferencia
  • LLM
  • Apple Silicon
  • Caché de KV
  • Aplicación de escritorio
  • API
  • Despliegue local
  • CLI

Resumen

oMLX es un servidor de inferencia LLM optimizado para Apple Silicon con procesamiento por lotes continuo y caché jerárquica de KV (RAM + SSD) que permite reutilizar el contexto histórico entre peticiones. Se gestiona desde la barra de menú de macOS, ofrece API compatible con OpenAI y Anthropic, sop…

README

<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…

查看完整页面