«Передовая, но неоднозначная»: Google представила Gemini 4 Argon
/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F137%2F1c0167637d386e63c96429f25c24248f.png)
Google представила свою новую флагманскую модель Gemini 4 с некоторыми впечатляющими результатами, но один из отчетов предполагает, что в отдельных случаях она может «плохо справляться».
Bloomberg сообщает, что сотрудники Google выявили внутри компании: показатели Gemini 4 в реальных условиях использования не всегда соответствуют по результатам бенчмарков. Во время презентации Gemini 4 Argon компания Google продемонстрировала, что новая модель опередила конкурентов, в частности GPT-6 Astra от OpenAI, во многих ключевых областях.
Новая передовая модель
В отчете приводятся слова сотрудников Google, которые обнаружили, что модель «хуже справляется, когда сотрудники фактически используют её в работе», а также что она «испытывает трудности с выполнением определённых задач по программированию». В Google, комментируя эти утверждения для Bloomberg, заявили:
«Было бы неверно утверждать, что Gemini 4 показывает слабые результаты в таких областях, как программирование».
Компания также сослалась на слова руководителя Google DeepMind Корая Кавукчуоглу, высказанные в конце сентября, который сказал, что «совершенно точно, что мы всегда будем на передовой». В отчете цитируется один из сотрудников Google, который сказал:
«Среди сотрудников сложился широкий консенсус по поводу того, что Gemini 4 находится на передовом уровне, в то время как другие опасаются, что Gemini всё равно будет отставать от конкурирующих моделей Anthropic и OpenAI».
Очевидно, что среди сотрудников существуют разные мнения о производительности модели. Впрочем, Gemini 4 Argon приносит ряд желательных улучшений модели, в частности увеличение лимита исходных данных — до 1 миллиона токенов.
Кибербезопасность на уровне
Google также пояснила, что модель «обладает очень высокими возможностями в сфере кибербезопасности» и демонстрирует «ведущие результаты» в других сценариях использования. Argon научили самостоятельно находить, проверять и исправлять критические уязвимости в программном обеспечении. В ходе ранней демонстрации модель выявила критическую проблему в медицинском программном обеспечении, используемом больницами по всему миру, что потенциально может привести к раскрытию конфиденциальной информации. По данным Google, на CWE-bench Argon набрала 68%, разделив первое место с GPT-6 Astra.
В связи с кибербезопасностью Google решила не открывать Argon сразу для всех пользователей. Первыми доступ получат участники программы Fairwind — правительственные структуры и проверенные партнеры, занимающиеся кибербезопасностью. Gemini 4 Argon стоит «$4 за 1 млн входящих токенов и $20 за 1 млн исходящих токенов», но на старте будет действовать вступительная цена, вдвое ниже этой.
Квантовые вычисления и защита от prompt injection
Внутреннее применение Gemini 4 Argon уже принесло Google ряд практических результатов. Компания использует эту модель для исследований в области квантовых вычислений, миграции программного кода и оптимизации памяти в своих дата-центрах. По данным Google, анализ телеметрических данных всей инфраструктуры помог освободить около 300 ТиБ памяти. Кроме того, специалисты Argon участвуют в переносе больших массивов кода C/C++ на Rust, в частности в библиотеках re2 и libgav1, а также в ядре Fuchsia OS Zircon, где речь идет о более чем 800 тыс. строк кода.
Еще одно направление работы Google — защита самой модели от опасного поведения. Argon получила усиленную защиту от косвенных атак типа prompt injection, когда вредоносные инструкции пытаются заставить ИИ может изменить своё поведение под влиянием данных, которые он обрабатывает. Google также внедрила механизмы мониторинга цепочки рассуждений и действий модели, которые должны останавливать её работу в случае опасного поведения. Компания объясняет эти меры необходимостью усилить контроль перед более широким внедрением модели.
Источник: 9to5Google