omlx jundot

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

주요 언어
Python
Stars
18,882
Forks
1,642

태그

  • 로컬 실행
  • LLM 인퍼런스 서버
  • Apple Silicon
  • 멀티모달
  • CLI도구
  • 데스크톱 앱
  • 벤치마크
  • 추론 가속

요약

oMLX는 Apple Silicon(M1-M4)에서 최적화된 LLM 추론 서버로, 연속 배칭과 Hot(RAM)+Cold(SSD) 계층형 KV 캐시를 통해 효율적인 추론을 제공합니다. macOS 메뉴바 앱과 CLI를 통해 LLM/VLM/임베딩/리랭커 등 멀티 모델을 관리하고, OpenAI/Anthropic API를 완전 대체하며 Claude Code, Codex, Copilot 등과 통합됩니다. 관리자 대시보드에서 채팅, 모델 다운로드, 벤치마크, 모델별 설정을 지원하며 macOS 사용자에게 로컬 추론 서버 운영을 위한 원스톱 솔루…

README

<p align="center"> <picture> <source media="(prefers-color-scheme: dark)" srcset="docs/images/icon-rounded-dark.svg" width="140"> <source media="(prefers-color-scheme: light)" srcset="docs/images/icon-rounded-light.svg" width="140"> <img alt="oMLX" src="docs/images/icon-rounded-light.svg" width="14…

查看完整页面