Speech-to-Speech pipeline с низкой задержкой и модульной архитектурой: VAD, STT, LLM, TTS. Каждый компонент заменяем. Совместимость с OpenAI Realtime API через WebSocket. Можно использовать локальные модели или облачные.
Компоненты работают в отдельных потоках, соединённых очередями. VAD (Silero) определяет границы речи, STT транскрибирует, LLM генерирует ответ, TTS синтезирует аудио. Поддерживаются различные бэкенды через CLI.
