oMLX — это инструмент для запуска LLM на Mac с оптимизацией под Apple Silicon. Он позволяет закреплять часто используемые модели в памяти, автоматически заменять их на более тяжелые по запросу, а также задавать лимиты контекста. Управление осуществляется через меню-бар. Благодаря персистентному KV-кэшу, который хранится в оперативной памяти и на SSD, контекст сохраняется между запросами, что ускоряет работу.
Установка проста: скачайте приложение из раздела Releases, перетащите в Applications — и готово. Встроенная функция автообновления и CLI-обертка позволяют управлять сервером из терминала или через Apple Shortcuts. Сервер автоматически обнаруживает модели в поддиректориях, поддерживает OpenAI-совместимый API и включает встроенный чат-интерфейс. Поддерживаются текстовые LLM, VLM, OCR, эмбеддинги и реранкеры.
Для некоторых моделей, например GLM-5.2 и MiniM3, доступны нативные кастомные ядра, которые значительно ускоряют инференс, но требуют сборки с Xcode. Также oMLX поддерживает распределенные вычисления на нескольких Mac, веб-интерфейс для мониторинга и управления, а также мультиязычный интерфейс (включая русский).
GitHub ★ 18,834
