Сбер разрабатывает голосового ИИ с полным дуплексом — система сможет одновременно слушать и говорить. Об этом сообщил директор по развитию технологий ИИ банка Сергей Марков.
Современные голосовые ассистенты работают в полудуплексном режиме: пользователь говорит, система обрабатывает запрос, затем отвечает, используя разные нейросети на каждом этапе. Новая технология будет основана на единой модели, которая слушает, обдумывает ответ и говорит параллельно. При поддержке видеомодальности она сможет видеть пользователя и управлять движениями аватара.
В России подобных решений ранее не анонсировали. У «Яндекса» есть Realtime API, который быстро отвечает и может перебивать, но всё же ожидает смены реплики. Полнодуплексная система слушает непрерывно, даже во время собственного ответа.
Первой в мире такую модель представила французская Kyutai в 2024 году (Moshi), затем появились Google Gemini Live и OpenAI GPT-Live. С полным дуплексом время ответа сократится до 160–320 мс — примерно как в разговоре людей.
