Queen

STT-библиотека на C/C++ для инференса речевых моделей через ggml

Библиотека для распознавания речи на C/C++, обеспечивающая инференс моделей speech-to-text. Работает с GGUF-моделями на рантайме ggml, поддерживает бэкенды Metal, Vulkan и CUDA для быстрого GPU-инференса, а также CPU-путь с ускорением tinyBLAS.

Поддерживается 16 семейств моделей и 60+ вариантов в потоковом и пакетном режимах. Среди них Parakeet, Canary, Whisper, GigaAM, Moonshine, Qwen3-ASR, SenseVoice, Voxtral и другие. Каждая публикуемая модель численно проверена и протестирована по WER относительно эталонной реализации.

Metal включается автоматически на Apple Silicon, для Linux и Windows доступен Vulkan. Готовые GGUF-файлы размещены на Hugging Face, а конвертер загружает модели напрямую из чекпоинтов NVIDIA NeMo. Вход должен быть в формате 16 кГц моно WAV.

Есть официальные привязки к другим языкам: Python, TypeScript/JavaScript, Rust и Swift/ObjC. Проект начался как исследование при поддержке программы BiR от Mozilla AI, а Hugging Face и Modal предоставили хранилище и GPU-кредиты для тестирования.

GitHub ★ 1,018

0 комментариев

Редактор комментария
Пока нет комментариев
Станьте первым, кто оставит мнение на этот топик