Anthropic випускає Opus 5.5: нижчі ціни та продуктивність рівня Fable
/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F137%2F9f64091692faa57ef35718e847c0399f.jpg)
Вчора Anthropic випустила свою новітню модель Opus 5.5, яка, за словами компанії, встановлює новий стандарт продуктивності у програмуванні та роботі зі знаннями. Opus є найпотужнішим і найдорожчим рівнем у трирівневій лінійці Claude від Anthropic; Sonnet посідає середнє місце, а Haiku є найшвидшим і найдешевшим. Примітно, що Anthropic заявляє: нова модель випереджає більшу модель Fable у багатьох тестах і впоралася з низкою неформальних завдань, які Fable не змогла виконати.
Нова модель також значно дешевша за попередницю. Вихідні токени для Opus 5.5 коштуватимуть $20 за мільйон токенів проти $25 за попередню модель. Інші показники ціни також знизилися приблизно так само. Модель також працює швидше, що відображає загальне зниження обчислювальних ресурсів, необхідних для її роботи. Нова версія також суттєво змінила спосіб спілкування Opus: Opus 5.5 рідше використовує жаргон і частіше розміщує важливу інформацію на початку своїх повідомлень.
“Запуск відбувся лише через два місяці після релізу Opus 5 24 липня. Згідно з оголошенням, Sonnet 5.5 і Haiku 5.5, наступні рівні лінійки, будуть випущені “у найближчі тижні” з аналогічними покращеннями продуктивності”, — пише TechCrunch.
Anthropic заявляє, що Opus 5.5 можна порівняти з Mythos за можливостями у біології та кібербезпеці, тому його випуск підпадає під ті самі заходи безпеки, що й модель Fable. Ці заходи обмежують використання моделей для пошуку експлойтів у скомпільованих програмах або розробки біологічної зброї, яку можна розпізнати, серед інших завдань.
Opus 5.5 є першим релізом моделі Anthropic після того, як генеральний директор компанії Даріо Амодей підтримав заклики уповільнити розвиток передових систем, навмисно стримуючи прогрес у можливостях ШІ, щоб він відповідав темпам розвитку методів забезпечення безпеки.
“Я переконався, що для повного подолання ризиків потрібна ще більша обережність”, — написав Амодей у дописі на початку цього місяця, — “Не лише інвестування у запобігання ризикам, а й регулювання темпів розвитку можливостей таким чином, щоб запобігання ризикам встигало за ними”.
Навчання Opus 5.5 щодо безпеки загалом було схожим на навчання його попередників, із тестуванням узгодженості та передрелізною оцінкою з боку зовнішніх організацій, таких як METR і Frontier Design. Водночас Anthropic наголосила, що для майбутніх моделей уже готуються досконаліші системи навчання та оцінювання, зокрема покращені системи безпеки й моніторингу.
“У міру того, як ШІ стає потужнішим, державна політика має відігравати більшу роль у забезпеченні безпеки систем, на які покладаються люди. Створення такого потенціалу потребує часу, і ми вже почали створювати інфраструктуру для підтримки цих зусиль”, — йдеться в дописі в блозі. — “Ми очікуємо незабаром поділитися детальнішою інформацією про ці зусилля”.
Anthropic наводить конкретні приклади роботи Opus 5.5 із великими програмними проєктами. Один із ранніх тестувальників за допомогою моделі виконав міграцію кодової бази обсягом 680 000 рядків менше ніж за добу — за оцінкою компанії, для команди інженерів така робота могла б зайняти кілька тижнів.
В іншому тесті модель 39 разів із 40 успішно скоротила час завантаження сторінок вебзастосунку, тоді як Opus 5 робила менші зміни, які водночас могли змінювати поведінку програми. Показовим став і внутрішній тест із HAProxy — програмним забезпеченням для балансування веб-трафіку між серверами.
“Opus 5.5 і Fable 5.1 мали перенести його з C на Rust, причому обидві версії пройшли майже всі власні регресійні тести HAProxy. Opus 5.5 завершила завдання за 9,5 години проти 12 годин у Fable 5.1, витративши на нього на 51% менше коштів. Для Opus 5.5 також маємо окремий швидкий режим у Claude Code та Claude Platform. Він може прискорювати роботу до 2,5 раза, але має іншу тарифікацію — $8 за мільйон вхідних токенів і $40 за мільйон вихідних”, — йдеться у офіційному релізі Anthropic.
Anthropic окремо посилила захист моделі від атак через prompt injection. За даними компанії, Opus 5.5 не поступається Opus 5 у всіх протестованих сценаріях, включно з програмуванням, використанням інструментів, взаємодією з комп’ютером і вебпереглядом. У тесті компанії Gray Swan нова модель показала такий самий найнижчий рівень успішності prompt injection, як і Fable 5.1.
Джерело: TechCrunch