Не вірте вухам: Google Gemini 3.5 Live Translate перекладатиме 70 мовами без пауз
Донедавна синхронний переклад вимагав складного обладнання та участі фахівців, а машинні перекладачі часто створювали незручні паузи, чекаючи завершення фрази. Однак Google з оголосила про розробку моделі, яка здатна обробляти аудіопотік безперервно, з мінімальною затримкою лише в кілька секунд. Завдяки цій здатності переклад генерується синхронно з мовленням спікера, зберігаючи природний темп і інтонацію.
Gemini 3.5 Live Translate автоматично розпізнає понад 70 мов, що уможливлює понад 2000 мовних комбінацій. Ця технологія розроблена так, щоб зберігати оригінальну інтонацію, темп мовлення та висоту голосу співрозмовника. Вона також адаптована для стабільної роботи навіть у noisy environments, що розширює її застосування за межі контрольованих студійних умов.
Запуск цієї інновації відбувається поетапно, і вже найближчим часом вона почне інтегруватися в ключові продукти Google. Для користувачів Google Meet покращений голосовий переклад буде доступний у рамках закритого попереднього перегляду для бізнес-клієнтів Google Workspace вже цього місяця, з ширшим запуском, запланованим на кінець року.
Звичайні користувачі також скоро отримають доступ до нової функції. Оновлення застосунку Google Translate для Android та iOS дозволить отримувати синхронний переклад через навушники. Для власників Android-пристроїв навіть передбачений режим прослуховування, який дає змогу піднести телефон до вуха і чути переклад безпосередньо через динамік.
З метою безпеки та для боротьби з дезінформацією весь аудіоконтент, створений Gemini 3.5 Live Translate, маркується цифровим водяним знаком SynthID. Цей непомітний для слухача водяний знак дозволяє визначати контент, згенерований штучним інтелектом, що є важливим кроком у забезпеченні правдивості інформації.
Технологія Gemini 3.5 Live Translate вже доступна для розробників через Gemini Live API та Google AI Studio. Зовнішні партнери, такі як Agora, LiveKit, Vision Agents та азіатський сервіс таксі Grab, вже тестують цю модель. Зокрема, Grab використовує її для багатомовного спілкування між водіями та пасажирами, обробляючи понад 10 мільйонів голосових дзвінків щомісяця. Це демонструє значний потенціал технології для інтеграції в різноманітні сервіси миттєвого усного перекладу.
Раніше Google вже демонстрував прогрес у сфері штучного інтелекту, запустивши застосунок Google AI Edge Eloquent для перетворення мовлення на текст, який працює без підключення до інтернету. Цей додаток використовує моделі автоматичного розпізнавання мовлення Gemma та доступний для завантаження на iOS. Розробники також можуть інтегрувати технологію в багатомовні дзвінки, онлайн-уроки, трансляції та міжнародні конференції, розширюючи її застосування.
"3.5 Live Translate безперервно генерує мовлення, балансуючи між необхідністю чекати на контекст для покращення якості та потребою перекладати негайно, щоб залишатися синхронізованою з мовцем", — зазначають у Google, підкреслюючи складність балансування між швидкістю та точністю.
"Цей непомітний водяний знак безпосередньо вплітається в аудіовихід, забезпечуючи можливість виявлення контенту, створеного ШІ, що допомагає запобігати дезінформації", — додають у Google, говорячи про важливість захисту від фейкових аудіозаписів та дезінформації.
Запуск Gemini 3.5 Live Translate є важливим кроком у подоланні мовних бар’єрів та зближенні культур. Ця технологія не тільки покращує комунікацію в реальному часі, але й відкриває нові можливості для глобального співробітництва, усуваючи одну з найбільших перешкод у сучасному світі.