Google представила Gemini 3.5 Transcribe — новую модель для распознавания живой речи, которая умеет очищать текст от слов-паразитов, переводить речь на разные языки в реальном времени и лучше учитывать контекст сказанного.
Модель рассчитана как на обычную диктовку, например сообщений в мессенджерах, так и на взаимодействие с ИИ-ассистентом Gemini. Одной из её особенностей стала способность быстро исправлять ошибки в устной речи.
В Google приводят пример с изменением планов. Если человек сначала предлагает другу встретиться в одном кафе, а затем передумывает и называет другое место, Gemini 3.5 Transcribe убирает предыдущий вариант и оставляет в итоговом сообщении только актуальную информацию.
Модель также распознаёт лишние междометия и другие слова-паразиты, делая итоговый текст более аккуратным. Кроме того, она может переводить речь между разными языками непосредственно во время разговора.
По данным Google, во всех представленных компанией тестах Gemini 3.5 Transcribe показала результаты лучше конкурентов, в частности ElevenLabs Scribe v2.
API модели уже доступен разработчикам для интеграции в собственные продукты. Попробовать Gemini 3.5 Transcribe можно в Google AI Studio, клавиатуре Gboard для Android и приложении Gemini для macOS. В дальнейшем Google планирует добавить модель в браузер Chrome.