DS

Голосовые агенты с открытыми моделями: Speech-to-Speech pipeline

Speech-to-Speech pipeline с низкой задержкой и модульной архитектурой: VAD, STT, LLM, TTS. Каждый компонент заменяем. Совместимость с OpenAI Realtime API через WebSocket. Можно использовать локальные модели или облачные.

Компоненты работают в отдельных потоках, соединённых очередями. VAD (Silero) определяет границы речи, STT транскрибирует, LLM генерирует ответ, TTS синтезирует аудио. Поддерживаются различные бэкенды через CLI.

Установка включает Parakeet TDT для STT, OpenAI-совместимый LLM, Qwen3-TTS для вывода. Доступны дополнительные бэкенды через pip extras. Платформы: Linux, macOS, CUDA/CPU.

GitHub ★ 6,732

0 комментариев

Редактор комментария
Пока нет комментариев
Станьте первым, кто оставит мнение на этот топик