DS

Сбер разрабатывает голосовой ИИ с полным дуплексом

image source

Сбер разрабатывает голосового ИИ с полным дуплексом — система сможет одновременно слушать и говорить. Об этом сообщил директор по развитию технологий ИИ банка Сергей Марков.

Современные голосовые ассистенты работают в полудуплексном режиме: пользователь говорит, система обрабатывает запрос, затем отвечает, используя разные нейросети на каждом этапе. Новая технология будет основана на единой модели, которая слушает, обдумывает ответ и говорит параллельно. При поддержке видеомодальности она сможет видеть пользователя и управлять движениями аватара.

В России подобных решений ранее не анонсировали. У «Яндекса» есть Realtime API, который быстро отвечает и может перебивать, но всё же ожидает смены реплики. Полнодуплексная система слушает непрерывно, даже во время собственного ответа.

Первой в мире такую модель представила французская Kyutai в 2024 году (Moshi), затем появились Google Gemini Live и OpenAI GPT-Live. С полным дуплексом время ответа сократится до 160–320 мс — примерно как в разговоре людей.

источник

Загрузка страницы