Библиотека для распознавания речи на C/C++, обеспечивающая инференс моделей speech-to-text. Работает с GGUF-моделями на рантайме ggml, поддерживает бэкенды Metal, Vulkan и CUDA для быстрого GPU-инференса, а также CPU-путь с ускорением tinyBLAS.
Поддерживается 16 семейств моделей и 60+ вариантов в потоковом и пакетном режимах. Среди них Parakeet, Canary, Whisper, GigaAM, Moonshine, Qwen3-ASR, SenseVoice, Voxtral и другие. Каждая публикуемая модель численно проверена и протестирована по WER относительно эталонной реализации.
Metal включается автоматически на Apple Silicon, для Linux и Windows доступен Vulkan. Готовые GGUF-файлы размещены на Hugging Face, а конвертер загружает модели напрямую из чекпоинтов NVIDIA NeMo. Вход должен быть в формате 16 кГц моно WAV.
Есть официальные привязки к другим языкам: Python, TypeScript/JavaScript, Rust и Swift/ObjC. Проект начался как исследование при поддержке программы BiR от Mozilla AI, а Hugging Face и Modal предоставили хранилище и GPU-кредиты для тестирования.
GitHub ★ 1,018

0 комментариев