Google навчила Gemini “дивитися” відео вибірково: аналіз став на 66% дешевшим
Невдовзі після запуску сервісу для створення та редагування зображень Pics компанія Google представила функцію агентного аналізу відео для моделей Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite. Нова технологія дозволяє штучному інтелекту переглядати лише потрібні фрагменти відео замість аналізу всього матеріалу з фіксованою частотою кадрів. За даними компанії, це скорочує споживання токенів до 88%, знижує витрати на 66% і підвищує точність аналізу приблизно на 7%.
Gemini сам вирішує, що переглядати
На відміну від традиційної обробки, коли модель зчитує відео із заздалегідь визначеною частотою кадрів (за замовчуванням один кадр за секунду), агентний режим дозволяє Gemini самостійно обирати, які частини відео потрібно переглянути детальніше.
Модель аналізує візуальні кадри, аудіо та текстові розшифровки, повторно скануючи потрібні фрагменти з вищою частотою кадрів. Такий підхід дозволяє знаходити конкретні моменти з точністю до частки секунди, виявляти аномалії, підраховувати об'єкти й відповідати на складні запитання щодо багатогодинних записів.
Найвища ефективність
Google зазначає, що переваги особливо помітні під час роботи з тривалими відео — від 10-хвилинних інструкцій до 90-хвилинних лекцій і багатогодинних записів. У тестах LongVideoBench Gemini 3.7 Flash із агентним режимом продемонструвала найкраще співвідношення точності та вартості серед протестованих моделей, вийшовши на так звану межу Парето — оптимальний баланс між якістю результатів і витратами на обчислення.
Нові сценарії використання
Функція відкриває нові можливості для розробників, які працюють із великими відеоархівами. Зокрема, вона підтримує пошук монтажних склейок і миттєвих змін стану, пошук потрібної інформації в багатогодинних записах, повторний аналіз швидких рухів і точніше відстеження повторюваних дій та окремих об'єктів.
Уже доступно через API
Агентний аналіз відео вже працює через Gemini API в Google AI Studio та Gemini Enterprise Agent Platform. Функція підтримує як завантажені відео, так і ролики з YouTube.
Для активації достатньо встановити режим обробки agentic у конфігурації API. Додаткова плата за нову можливість не стягується — вона використовує стандартні тарифи Gemini API.
Google також повідомила, що найближчим часом технологія стане доступною всім користувачам застосунку Gemini. У наступні місяці вона почне працювати й у функції Ask YouTube, яка відповідатиме на запитання з урахуванням не лише субтитрів, а й візуального змісту відео.
Нещодавно Google представила Gemini 3.5 Transcribe — спеціалізовану модель для розпізнавання та структурування мовлення в реальному часі й з аудіозаписів, яка стала наступницею системи Chirp 3. Технологія підтримує понад 85 мов, працює із затримкою менш як секунда та автоматично очищає текст від слів-паразитів, фіксуючи самовиправлення спікера й розділяючи голоси співрозмовників.