Google представила Gemini 3.5 Transcribe: в скором времени она появится в Chrome
/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F137%2Fae00508f5d826950baeb941a4f611c2d.png)
Вчера Google представила Gemini 3.5 Transcribe как свою «самую точную модель преобразования речи в текст», которая уже используется в нескольких собственных продуктах компании. В отличие от обычных моделей распознавания речи, которым сложно работать с фоновым шумом, сложную терминологию и необходимость очистки речи от пауз и ошибок, Gemini 3.5 Transcribe напрямую преобразует необработанную аудиозапись в точный, отредактированный и структурированный текст.
Эта модель «разработана для того, чтобы фиксировать естественную манеру вашей речи, лучше понимать ваши намерения и распознавать вашу лексику». Gemini 3.5 Transcribe может обрабатывать самоисправления («встретимся во вторник — нет, в среду») и удалять из конечного результата «эээ», «эм» и другие слова-паразиты, а также автоматически форматировать текст и позволять редактировать его естественным голосом. Кроме того, вот что анонсирует Google:
- Более точная транскрипция: По данным измерений Artificial Analysis, модель демонстрирует среднюю частоту ошибок в словах (WER) на уровне 4,0 % при потоковой обработке и 2,6 % при непотоковой обработке. Она демонстрирует высокую эффективность в реальных условиях с шумом, точно распознавая буквенно-цифровые данные, такие как почтовые индексы и номера заказов.
- Собственный словарь: распознает специализированную терминологию и уникальные варианты написания, беспрепятственно адаптируя транскрипцию к предоставленному пользователем собственному словарю.
- Поддержка языков по всему миру: автоматически распознает и транскрибирует более 85 языков, беспрепятственно работая с региональными акцентами и различными диалектами.
- Идентификация нескольких говорящих: точно определяет, кому принадлежит каждая реплика в предварительно записанном аудио, добавляя временные метки для трёх говорящих. Поддержка более трёх говорящих пока находится в экспериментальной стадии.
Что касается производительности, Gemini 3.5 Transcribe, по словам Google, обеспечивает «значительный прорыв» в различных возможностях, демонстрирует улучшенный показатель частоты ошибок в словах и значительно меньшую задержку по сравнению с моделью транскрипции Chirp 3, представленной в 2025 году. По данным Artificial Analysis, время до получения окончательной транскрипции, например, сократилось на 70%.
В тесте FLEURS, проведённом для ряда основных языков и локалей, модель демонстрирует точную многоязычную работу, превосходя Chirp 3, достигающий показателя WER на уровне 5,50 % в потоковом режиме и 5,04 % в непотоковом.
«Еще одна цель заключается в том, чтобы позволить пользователям «выполнять задачи с помощью голоса». Функция вызова функций позволяет Gemini 3.5 Transcribe «передавать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini». Это можно увидеть в функции Speak to Window в приложении Gemini для macOS», — пишет 9to5Google.
Помимо приложения Gemini для macOS и Rambler в Gboard на Android, Gemini 3.5 Transcribe доступно в поле ввода подсказок с микрофоном в Google Antigravity. Следующим местом появления модели станет браузер Chrome, где она позволит «говорить для ввода текста в любом веб-поле, упрощая диктовку ответов, написание публикаций или более естественный и удобный ввод подсказок для Gemini в Chrome». Gemini 3.5 Transcribe доступна:
- Для разработчиков: в режиме публичного предварительного просмотра через Gemini API в Google AI Studio и Google Antigravity.
- Для предприятий: в режиме публичного предварительного просмотра через Gemini Enterprise Agent Platform, а в скором времени также появится в Gemini Enterprise for Customer Experience.
В приложении Gemini для macOS возможности модели не ограничатся преобразованием речи в текст. Голосовые команды могут использовать контекст того, что происходит на экране, а Gemini способна привлекать другие модели в фоновом режиме для выполнения более сложных операций. Google также раскрыла технические детали интеграции модели для разработчиков. Gemini 3.5 Transcribe работает через два отдельных API:
- Первый предназначен для потоковой обработки в реальном времени и обеспечивает непрерывную двунаправленную передачу аудио с задержкой менее секунды.
- Второй используется для уже записанного аудио — в частности, записей встреч, телефонных разговоров и журналов звонков — и поддерживает распознавание говорящих и временные метки для отдельных слов.
Отдельным преимуществом стала способность модели переключаться между языками прямо во время разговора. Gemini 3.5 Transcribe может автоматически определять язык и продолжать потоковую транскрипцию даже в тех случаях, когда пользователь переключается между языками. Это особенно важно для многоязычных диалогов, где в традиционных системах часто приходится отдельно задавать язык распознавания.
Источник: 9to5Google