SpaceXAI выпустила Grok 4.6: модель догнала GPT-5.6 Sol в области программирования и работы агентов
Компания SpaceXAI (ранее xAI) представила Grok 4.6 — новую версию своей флагманской модели искусственного интеллекта. Разработчики сосредоточились на долгосрочной работе ИИ-агентов, программировании и создании интерактивных и визуальных проектов. Модель Grok 4.6 сравнялась с GPT-5.6 Sol, которую компания OpenAI представила в прошлом месяце, говорится в официальном блоге SpaceXAI.
Создание Grok 4.6
Grok 4.6 был создан на основе Grok 4.5, но модель прошла более длительный дополнительный этап обучения. SpaceXAI использовала данные для развития логического мышления, технических навыков и программной инженерии, а также усовершенствовала оптимизатор и процесс обучения.
После этого разработчики использовали Grok 4.5 для генерации обучающих траекторий, которые модель проходила в сферах STEM, программирования и работы со знаниями. Grok 4.6 также обучали выполнению агентских задач, в частности в веб-разработке, оптимизации кода и автоматизированном проектировании.
Обновление Grok
Одним из главных направлений обновления стала способность модели работать над сложными задачами в течение длительного времени. Grok 4.6 может:
- исследовать незнакомую тему;
- структурировать программу;
- реализовывать основные функции программы;
- проверять собственную работу;
- вносить изменения после нескольких раундов обратной связи.
SpaceXAI также отмечает улучшения в создании визуальных и интерактивных проектов. По словам разработчиков, модель может за один проход сформировать структуру программы и ее визуальный стиль, после чего пользователь может доработать результат.
В компании заявляют, что наряду с расширением возможностей модели была укреплена и система безопасности. SpaceXAI провела более масштабное, чем ранее, тестирование перед запуском, а также после развертывания и с привлечением сторонних экспертов.
Результаты тестирований
По показателю AA Intelligence Grok 4.6 получил 61 балл, столько же, сколько GPT-5.6 Sol в приведенных SpaceXAI сравнениях. У Claude Fable 5 компании Anthropic этот показатель составляет 62 балла. Для сравнения: предыдущая версия Grok 4.5 набрала 56 баллов.
В ряде других тестов Grok 4.6 также продемонстрировал улучшение по сравнению с предыдущей версией. В частности, в GDPVal-AA v2 он набрал 1753 балла против 1526 у Grok 4.5, в CursorBench v3.2 — 69,9% против 66,7%, а в DeepSWE v1.1 65,9% против 54%.
В некоторых тестах новая модель уступила конкурентам. Например, в CursorBench Fable 5 набрал 70,5%, в DeepSWE GPT-5.6 Sol — 73%, а в FrontierCode Fable 5 — 63,6% против 61,3% у Grok 4.6.
Grok 4.6 уже доступен в Cursor и Grok Build, а также через API и партнерские платформы, среди которых OpenRouter, Vercel и Cloudflare. Цена начинается от $2 за миллион входных токенов и $6 за миллион выходных, быстрый режим стоит вдвое дороже.
Напомним, что основатель SpaceXAI Илон Маск в ходе судебных слушаний против OpenAI признал, что его компания «частично» применяла методы дистилляции на моделях конкурента для обучения чат-бота Grok. Практика дистилляции — — использование ответов более мощных ИИ-систем для обучения новых моделей — остается одним из самых острых предметов споров об интеллектуальной собственности и конкуренции среди ведущих разработчиков искусственного интеллекта.