Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking
Google представила две новые голосовые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они призваны сделать общение с ИИ более быстрым, естественным и подходящим для сложных многоэтапных задач. Модели ориентированы как на пользователей Gemini, Workspace и Search, так и на разработчиков корпоративных голосовых агентов. Об этом сообщила компания Google.
Компания называет Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking своими самыми продвинутыми системами для живого диалога. Основная цель обновления — сделать взаимодействие с ИИ более интуитивным и интеллектуальным. Новые модели получили усовершенствованную способность к рассуждению практически в режиме реального времени и ориентированы прежде всего на голосовые сценарии.
Gemini 3.8 Live создана с расчетом на масштабируемость и экономическую эффективность. Она сочетает в себе диалоговые возможности, плавную речь и работу с визуальным контекстом. Gemini 3.8 Live Extended Thinking предназначена для более сложных сценариев. Модель получила усовершенствованное многошаговое рассуждение и более высокий уровень интеллекта для задач, требующих более глубокого анализа.
Google позиционирует обе системы как основу для надёжных голосовых агентов, готовых к использованию в производственных средах. Они также должны улучшить голосовое взаимодействие с Gemini в приложении компании, Google Workspace и поиске.
Gemini 3.8 Live Extended Thinking заняла первое место в рейтинге Artificial Analysis Speech to Speech Quality Index с результатом 82,6 балла. Модель также показала 68,6% в тесте τ-Voice на выполнение агентских задач и 35,1% в банковском тесте Sierra τ-Voice. В тесте Big Bench Audio она набрала 97,7%. Google подчеркивает, что модель сочетает высокие результаты с конкурентоспособной стоимостью по сравнению с другими передовыми системами.
Gemini 3.8 Live также получила высокие оценки пользователей и заняла второе место в Speech Agent Arena. Компания отдельно отмечает её экономичность и пригодность для масштабного корпоративного использования.
В тесте EVA-Bench от ServiceNow обе новые модели достигли так называемого предела Парето. Речь идет о балансе между точностью выполнения сложных задач и качеством диалога.
Gemini 3.8 Live обрабатывает визуальный контент практически в реальном времени. Это позволяет системе учитывать изображения и другие визуальные данные во время разговора. Модель также автоматически распознает и переключается между 97 поддерживаемыми языками без прерывания диалога. Кроме того, система может запускать инструменты и API в фоновом режиме. При этом разговор с пользователем не прерывается. Модель может подтвердить получение запроса и продолжить диалог, пока задача выполняется.
Gemini 3.8 Live Extended Thinking получила ещё одну важную возможность — одновременно размышлять и говорить. Модель может выполнять сложные задачи в фоновом режиме и параллельно поддерживать разговор. Google отмечает, что система использует короткие естественные фразы вроде «Дайте проверю…», чтобы сразу реагировать на запрос. Она также может в реальном времени объяснять ход выполнения многошаговых задач.
Компания рассчитывает, что эти возможности сделают работу с Gemini в Google Workspace и Search более совместной и естественной, особенно в сложных сценариях. Для разработчиков новые модели доступны через Gemini Live API. Его уже поддерживает ряд платформ для создания голосовых интерфейсов. Среди них Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Они берут на себя инфраструктуру потоковой передачи медиа в реальном времени и позволяют разработчикам сосредоточиться на самом интерфейсе и сценариях работы.
Google также сотрудничает с Salesforce, Genspark и Lumeris. В компании отмечают, что партнеры положительно оценивают задержку, плавность диалога и возможности вызова инструментов в Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking.
Напомним, что Google ещё в июле расширила линейку Gemini моделями 3.6 Flash, 3.5 Flash Lite и 3.5 Flash Cyber. Главной новинкой стала Gemini 3.6 Flash, которая заменила 3.5 Flash и получила улучшенные возможности программирования. Gemini 3.5 Flash Lite компания назвала своей наиболее эффективной моделью для масштабирования агентных решений с минимальными затратами. Gemini 3.5 Flash Cyber стала первой крупной языковой моделью Google для кибербезопасности.
Кроме того, расширение экосистемы Gemini уже сопровождается резким ростом её аудитории. В августе Сундар Пичаи сообщил, что приложение превысило 1 млрд ежемесячных активных пользователей и стало 14-м продуктом Google с таким показателем. Эта статистика касается только отдельного приложения и не учитывает пользователей Gemini в Search, Workspace, Android и других сервисах.