Google обновила Gemini Audio, представив новые модели семейства Gemini 3.5. Они получили улучшенные функции транскрибации с автоматическим распознаванием более 85 языков и специализированной терминологии.
В линейку вошли Gemini 3.5 Live, 3.5 Live Experimental и 3.5 Transcribe. Модели нацелены на повышение точности голосового управления ИИ-функциями Google, включая устойчивость к фоновому шуму и прерываниям речи.
Gemini 3.5 Transcribe — полностью новый продукт в семействе Gemini. Он появился до выхода обещанной ещё в июне модели Gemini 3.5 Pro, релиз которой пока задерживается.
По заявлению Google, 3.5 Transcribe представляет собой значительный шаг вперёд по сравнению с предыдущей моделью транскрибации Chirp 3, особенно в части многоязычной обработки и снижения количества ошибок распознавания.
Модель позволяет пользователям редактировать текст голосом естественным образом, автоматически форматируя речь и убирая слова-паразиты вроде «эм» и «ну».
Пользователи могут задавать собственный словарь терминов, чтобы модель корректно распознавала специфическую лексику и не требовала последующей ручной правки.
Также 3.5 Transcribe умеет различать до трёх говорящих в записанном аудио и расставлять временные метки для каждого слова.
Одновременно с Transcribe выходят Gemini 3.5 Live и 3.5 Live Experimental — развитие технологии распознавания речи, лежащей в основе голосового чата Gemini.
Gemini 3.5 Live лучше справляется с прерываниями речи на середине фразы, распознаванием языков и обработкой визуальной информации в реальном времени.
Gemini 3.5 Live Experimental идёт дальше: модель проговаривает свои рассуждения пошагово в реальном времени при решении сложных задач.
Обновления Gemini Audio уже начали внедряться на английском языке для всех пользователей приложения Gemini на macOS, а также в функции диктовки Rambler на Android в отдельных странах.
Модели также доступны разработчикам в публичном превью через Gemini API — в AI Studio и Antigravity. Поддержка в Chrome появится в ближайшее время, сообщает Google.
