Speech-to-Speech pipeline с низкой задержкой и модульной архитектурой: VAD, STT, LLM, TTS. Каждый компонент заменяем. Совместимость с OpenAI Realtime API через WebSocket. Можно использовать локальные модели или облачные.
Компоненты работают в отдельных потоках, соединённых очередями. VAD (Silero) определяет границы речи, STT транскрибирует, LLM генерирует ответ, TTS синтезирует аудио. Поддерживаются различные бэкенды через CLI.
Установка включает Parakeet TDT для STT, OpenAI-совместимый LLM, Qwen3-TTS для вывода. Доступны дополнительные бэкенды через pip extras. Платформы: Linux, macOS, CUDA/CPU.
GitHub ★ 6,732

0 комментариев