Рівень Fable 5.1 за значно менші гроші: Anthropic випустила нову модель Claude Opus 5.5
Anthropic представила Claude Opus 5.5 — першу модель штучного інтелекту нового сімейства Claude 5.5, яка, за даними компанії, поєднує рівень продуктивності Claude Fable 5.1 із нижчою вартістю використання. Модель стала найбільшим оновленням після Claude Opus 5 і отримала нові механізми безпеки, швидшу генерацію відповідей та суттєве зниження вартості роботи через API. Розробники повідомили, що Opus 5.5 уже доступна на платформах Claude, Amazon Web Services, Google Cloud і Microsoft Azure.
Що змінилося в новій моделі
Anthropic заявляє, що Claude Opus 5.5 показує найкращі результати серед її моделей у програмуванні, роботі з великими обсягами знань та використанні комп'ютера. За даними компанії, один із ранніх тестувальників завершив міграцію кодової бази обсягом 680 тисяч рядків менш ніж за добу — завдання, яке зазвичай займає у команди інженерів кілька тижнів.
Під час внутрішніх випробувань модель успішно оптимізувала швидкість завантаження вебдодатків у 39 із 40 випадків, а також краще справлялася з масштабними аудитами коду. Наприклад, перевірку кодової бази на 200 тисяч рядків Opus 5.5 виконав менш ніж за три години, тоді як Opus 5 витратив понад 20 годин і використав у 2,5 раза більше токенів.
Окрему увагу Anthropic приділила якості письма. За словами розробників, Opus 5.5 рідше використовує складний жаргон, швидше переходить до головної думки та краще дотримується заданого стилю спілкування.
Результати тестувань
У компанії зазначають, що на бенчмарку Terminal-Bench 4.0 модель набрала 66,4%, випередивши Claude Fable 5.1 (55,8%) і Claude Opus 5 (52,3%). На GDPval-AA v2.1, який оцінює професійні завдання у 44 спеціальностях, Opus 5.5 отримав рейтинг 1846 Elo проти 1735 у Fable 5.1. Водночас Anthropic підкреслює, що лабораторні тести дедалі гірше відображають реальні відмінності між найпотужнішими моделями, тому більше уваги приділяє практичним сценаріям використання.
Вартість моделі
Одним із головних оновлень стала нова цінова політика. Вартість вхідних токенів зменшилася з 5 до 4 доларів за мільйон, вихідних — з 25 до 20 доларів, а читання кешу подешевшало на 60% — до 0,20 долара за мільйон токенів.
Згідно з оцінками Anthropic, за типовими навантаженнями використання Opus 5.5 обходиться приблизно на 40% дешевше, ніж Opus 5. Компанія також повідомила, що модель генерує відповіді більш ніж на 30% швидше. Крім того, для користувачів тарифів Pro, Max, Team і Enterprise збільшили п'ятигодинні ліміти використання та запровадили можливість зберігати скидання ліміту швидкості й використовувати його пізніше.
Безпека та нові обмеження
Перед запуском модель протестували незалежні організації Frontier Design і METR. За словами Anthropic, Opus 5.5 став найкращою моделлю компанії в автоматизованому аудиті поведінки — системі, що перевіряє ШІ майже у двох тисячах змодельованих сценаріїв.
У компанії також заявляють, що модель приблизно на 85% рідше намагалася обходити встановлені обмеження, ніж Opus 5 або Claude Mythos 5.1. При цьому Anthropic визнає, що оцінювання поведінки моделей усе ще має обмеження, оскільки сучасні системи дедалі частіше здогадуються, що проходять тестування.
Через високі можливості у кібербезпеці та біології Opus 5.5 отримав додаткові захисні механізми. Більшість запитів із кібербезпеки за замовчуванням перенаправлятимуться на менш потужну модель Opus 4.8, а академічні лабораторії, фармацевтичні компанії та стартапи зможуть отримати розширений доступ через окрему програму верифікації.
Нова модель зʼявилася на тлі масштабної дискусії в галузі ШІ щодо безпеки великих мовних моделей (LLM). Нагадаємо, що саме генеральний директор Anthropic закликав до скоординованого уповільнення темпів розвитку технології, і його тоді підтримали керівник OpenAI Сем Альтман та глава SpaceXAI Ілон Маск, який напередодні також випустив нову модель ШІ Grok 4.7. Занепокоєння лідерів індустрії раніше викликали ризики неконтрольованого самовдосконалення алгоритмів та інциденти зі зламами реальних систем.