Google представила Gemini 3.5 Transcribe: незабаром він з’явиться у Chrome
/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F137%2F767a94e76982c1d7a1f7dbc7f5838192.png)
Вчора Google представила Gemini 3.5 Transcribe як свою “найточнішу модель перетворення мовлення на текст”, яка вже використовується в кількох власних продуктах компанії. На відміну від звичайних моделей розпізнавання мовлення, яким складно працювати з фоновим шумом, складною термінологією та очищенням мовлення від пауз і помилок, Gemini 3.5 Transcribe безпосередньо перетворює необроблений аудіозапис на точний, відредагований і структурований текст.
Ця модель “розроблена для того, щоб фіксувати природну манеру вашого мовлення, краще розуміти ваш намір і розпізнавати власну лексику”. Gemini 3.5 Transcribe може обробляти самовиправлення (“зустріньмося у вівторок — ні, у середу”) та видаляти з кінцевого результату “еее”, “ем” та інші слова-паразити, а також автоматично форматувати текст і дозволяти редагувати його природним голосом. Крім того, ось що анонсує Google:
- Точніша транскрипція: за вимірюваннями Artificial Analysis, модель досягає середньої частоти помилок у словах (WER) на рівні 4,0% під час потокової передачі та 2,6% у випадках непотокової обробки. Вона демонструє високу ефективність у реальних умовах із шумом, точно розпізнаючи буквено-цифрові дані, такі як поштові індекси та номери замовлень.
- Власний словник: розпізнає спеціалізовану термінологію та унікальні варіанти написання, безперешкодно адаптуючи транскрипцію до наданого користувачем власного словника.
- Глобальна мовна підтримка: автоматично визначає та транскрибує понад 85 мов, безперешкодно працюючи з регіональними акцентами та різними діалектами.
- Ідентифікація кількох мовців: точно визначає, кому належить кожна репліка в попередньо записаному аудіо, додаючи часові позначки для трьох мовців. Підтримка понад трьох мовців поки що є експериментальною.
Щодо продуктивності, Gemini 3.5 Transcribe, за словами Google, забезпечує “значний прорив” у різних можливостях, демонструє покращену частоту помилок у словах і значно меншу затримку порівняно з моделлю транскрипції Chirp 3, представленою у 2025 році. За даними Artificial Analysis, час до отримання фінальної транскрипції, наприклад, скоротився на 70%.
У тесті FLEURS, проведеному для низки основних мов і локалей, модель демонструє точну багатомовну роботу, перевершуючи Chirp 3 та досягаючи WER на рівні 5,50% у потоковому режимі та 5,04% у непотоковому.
“Ще одна мета полягає в тому, щоб дозволити користувачам “виконувати завдання за допомогою голосу”. Функція виклику функцій дає Gemini 3.5 Transcribe змогу “передавати складні завдання, такі як генерація зображень і аналіз файлів, іншим моделям Gemini”. Це можна побачити у функції Speak to Window у застосунку Gemini для macOS”, — пише 9to5Google.
Окрім застосунку Gemini для macOS і Rambler у Gboard на Android, Gemini 3.5 Transcribe доступний у полі введення промптів із мікрофоном у Google Antigravity. Наступним місцем появи моделі стане браузер Chrome, де вона дозволить “говорити для введення тексту в будь-якому вебполі — спрощуючи диктування відповідей, написання публікацій або природніше й легше введення промптів для Gemini у Chrome”. Gemini 3.5 Transcribe доступна:
- Для розробників: у режимі публічного попереднього перегляду через Gemini API у Google AI Studio та Google Antigravity.
- Для підприємств: у режимі публічного попереднього перегляду через Gemini Enterprise Agent Platform, а незабаром також з’явиться в Gemini Enterprise for Customer Experience.
У застосунку Gemini для macOS можливості моделі не обмежуватимуться перетворенням сказаного на текст. Голосові команди можуть використовувати контекст того, що відбувається на екрані, а Gemini здатна залучати інші моделі у фоновому режимі для виконання складніших операцій. Google також розкрила технічну сторону інтеграції моделі для розробників. Gemini 3.5 Transcribe працює через два окремі API:
- Перший призначений для потокової обробки в реальному часі та забезпечує безперервну двонапрямну передачу аудіо із затримкою менше секунди.
- Другий використовується для вже записаного аудіо — зокрема зустрічей, телефонних розмов і журналів дзвінків — та підтримує визначення мовців і часові позначки для окремих слів.
Окремою перевагою стала здатність моделі працювати зі зміною мов просто під час розмови. Gemini 3.5 Transcribe може автоматично визначати мову та продовжувати потокову транскрипцію навіть тоді, коли користувач перемикається між мовами. Це особливо важливо для багатомовних діалогів, де традиційним системам часто доводиться окремо задавати мову розпізнавання.
Джерело: 9to5Google