omlx jundot

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

Hauptsprache
Python
Stars
18,882
Forks
1,642

Tags

  • CLI-Tool
  • Desptop-App
  • LLM-Inferenz
  • macOS
  • Lokale KI
  • MCP
  • Tool-Aufruf
  • Backend

Zusammenfassung

oMLX ist ein LLM-Inferenzserver, der für Apple Silicon optimiert ist und LLMs mit kontinuierlichem Batching sowie einer zweistufigen KV-Cache-Architektur (Hot-RAM + Cold-SSD) direkt vom macOS-Menüleisten-App verwaltet. Es löst das Problem der Speicher- und Kontrollbalance lokaler LLM-Server, indem …

README

<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…

查看完整页面