Уровень Fable 5.1 за гораздо меньшие деньги: Anthropic выпустила новую модель Claude Opus 5.5
Компания Anthropic представила Claude Opus 5.5 — первую модель искусственного интеллекта нового семейства Claude 5.5, которая, по данным компании, сочетает в себе производительность Claude Fable 5.1 с более низкой стоимостью использования. Модель стала крупнейшим обновлением после Claude Opus 5 и получила новые механизмы безопасности, более быструю генерацию ответов и существенное снижение стоимости работы через API. Разработчики сообщили, что Opus 5.5 уже доступна на платформах Claude, Amazon Web Services, Google Cloud и Microsoft Azure.
Что изменилось в новой модели
Anthropic заявляет, что Claude Opus 5.5 демонстрирует лучшие результаты среди своих моделей в программировании, работе с большими объемами знаний и использовании компьютера. По данным компании, один из первых тестировщиков завершил миграцию кодовой базы объемом 680 тысяч строк менее чем за сутки — задачу, которая обычно занимает у команды инженеров несколько недель.
В ходе внутренних испытаний модель успешно оптимизировала скорость загрузки веб-приложений в 39 из 40 случаев, а также лучше справлялась с масштабными аудитами кода. Например, проверку кодовой базы объемом 200 тысяч строк Opus 5.5 выполнил менее чем за три часа, тогда как Opus 5 потратил более 20 часов и использовал в 2,5 раза больше токенов.
Особое внимание Anthropic уделила качеству письма. По словам разработчиков, Opus 5.5 реже использует сложный жаргон, быстрее переходит к главной мысли и лучше придерживается заданного стиля общения.
Результаты тестирований
В компании отмечают, что на бенчмарке Terminal-Bench 4.0 модель набрала 66,4%, опередив Claude Fable 5.1 (55,8%) и Claude Opus 5 (52,3%). На тесте GDPval-AA v2.1, который оценивает профессиональные задачи в 44 специальностях, Opus 5.5 получил рейтинг 1846 Elo против 1735 у Fable 5.1. В то же время Anthropic подчеркивает, что лабораторные тесты всё хуже отражают реальные различия между самыми мощными моделями, поэтому больше внимания уделяет практическим сценариям использования.
Стоимость модели
Одним из главных обновлений стала новая ценовая политика. Стоимость входных токенов снизилась с 5 до 4 долларов за миллион, выходных — с 25 до 20 долларов, а чтение кэша подешевело на 60% — до 0,20 доллара за миллион токенов.
По оценкам Anthropic, при типичных нагрузках использование Opus 5.5 обходится примерно на 40% дешевле, чем Opus 5. Компания также сообщила, что модель генерирует ответы более чем на 30% быстрее. Кроме того, для пользователей тарифов Pro, Max, Team и Enterprise увеличили пятичасовые лимиты использования и ввели возможность сохранять сброс лимита скорости и использовать его позже.
Безопасность и новые ограничения
Перед запуском модель протестировали независимые организации Frontier Design и METR. По словам Anthropic, Opus 5.5 стала лучшей моделью компании в автоматизированном аудите поведения — системе, проверяющей ИИ почти в двух тысячах смоделированных сценариев.
В компании также заявляют, что модель примерно на 85 % реже пыталась обходить установленные ограничения, чем Opus 5 или Claude Mythos 5.1. При этом Anthropic признает, что оценка поведения моделей по-прежнему имеет ограничения, поскольку современные системы всё чаще догадываются, что проходят тестирование.
Благодаря высоким возможностям в области кибербезопасности и биологии Opus 5.5 получил дополнительные защитные механизмы. Большинство запросов по кибербезопасности по умолчанию будут перенаправляться на менее мощную модель Opus 4.8, а академические лаборатории, фармацевтические компании и стартапы смогут получить расширенный доступ через отдельную программу верификации.
Новая модель появилась на фоне масштабной дискуссии в сфереИИ о безопасности крупных языковых моделей (LLM). Напомним, что именно генеральный директор Anthropic призвал к скоординированному замедлению темпов развития технологии, и его тогда поддержали руководитель OpenAI Сэм Альтман и глава SpaceXAI Илон Маск, который накануне также выпустил новую модель ИИ Grok 4.7. Обеспокоенность лидеров отрасли ранее вызывали риски неконтролируемого самосовершенствования алгоритмов и инциденты со взломами реальных систем.