Google показала Gemini 3.8 Live з живим аватаром та анонсувала Gemini 4
/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F137%2Fa9c47c899e5002ffffe6b136e040b3c1.png)
Google представила Gemini 3.8 Live with Live Avatar — нову версію своєї мультимодальної ШІ-моделі, яка додає до голосової розмови відеоаватар в реальному часі. Компанія також розповіла про нові моделі синтезу мовлення Gemini 3.8 Flash TTS і Flash-Lite TTS, а керівник Google DeepMind підтвердив, що Gemini 4 вже перебуває на етапі підготовки до релізу.
Gemini 3.8 Live отримала візуальну присутність
Live Avatar поєднує можливості Gemini для живого діалогу з потоковою генерацією відео з низькою затримкою. Як пояснює Google, система може одночасно слухати й аналізувати візуальну інформацію, а потім відповідати голосом і відео за допомогою динамічного цифрового персонажа.
“Аватари підтримують синхронізацію рухів губ із мовленням, природну міміку та плавне чергування реплік. Google позиціонує технологію насамперед для корпоративного використання — від обслуговування клієнтів до інтерактивних інструкцій і віртуальних помічників. Live Avatar вже доступний у Gemini Enterprise”, — пише Google у блозі.
Окремо Google додала можливість асинхронного виконання інструментів. Поки Gemini виконує завдання у фоновому режимі, наприклад, перевіряє дані або працює із зовнішнім сервісом, аватар може продовжувати розмову з користувачем, не перериваючи діалог.
“Ще одна особливість — мультимовність. Live Avatar підтримує синхронізацію мовлення, міміки та рухів губ у 97 мовах і може переходити між ними під час однієї розмови. Для компаній також передбачене створення власних аватарів на основі референсного зображення, хоча ця функція поки доступна лише через корпоративний allowlisting”, — йдеться у блогах Google.
Google заявляє, що всі згенеровані аудіо- та відеоматеріали отримують невидимий водяний знак SynthID. Він має допомагати визначати контент, створений ШІ, і зменшувати ризик його помилкової атрибуції.
Gemini 3.8 навчилася створювати голоси
Напередодні Google представила Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS — дві моделі для генерації мовлення з детальним керуванням голосом та інтонацією.
“Перша орієнтована на створення унікальних голосів із текстового опису. Користувач може задати характер, акцент та інші властивості голосу природною мовою, а також керувати виконанням кожної репліки окремо — темпом, емоціями, паузами та манерою мовлення. Flash-Lite TTS розрахована на масштабні завдання, зокрема дубляж, створення аудіоконтенту та голосових агентів”, — повідомляє Google.
Google заявляє також про бібліотеку з понад 2000 готових голосів і підтримку більш ніж 100 мов та діалектів. Модель також може відтворити голос за 30-секундним аудіозразком, якщо користувач має на це право. Для такої функції передбачені перевірка згоди, SynthID і облікові дані C2PA. Нові TTS-моделі вже почали розгортати в Gemini API та Google AI Studio. Flash TTS також з’являється в Gemini Notebook, а Flash-Lite TTS — у Google Vids.
Gemini 4 може вийти значно раніше кінця року
Паралельно Google готує наступну флагманську модель. Керівник Google DeepMind Корай Кавукчуоглу підтвердив виданню The Information, що Gemini 4 вже перейшла до етапу post-training — фінального доопрацювання базової моделі, яке включає перевірки безпеки, налаштування поведінки та захисних механізмів. Внутрішнє тестування Gemini 4 уже проводиться, зокрема для роботи Antigravity.
“Google хоче випустити ранню версію результатів post-training якнайшвидше, оскільки команда задоволена отриманими результатами. Ми сподіваємося на реліз значно раніше кінця 2026 року”, — заявив Кавукчуоглу, але конкретної дати компанія не назвала.
Таким чином, Google одночасно розширює Gemini у двох напрямках: робить взаємодію з ШІ більш схожою на спілкування з реальною людиною за допомогою Live Avatar і розвиває аудіогенерацію, поки наступне покоління Gemini 4 проходить фінальну підготовку до виходу.
Джерело: Google