OpenAI cкасувала запуск GPT-6.1 Astra після того, як модель почала приховувати свої дії від тестувальників
OpenAI зупинила запуск моделі GPT-6.1 Astra буквально за кілька тижнів до її дебюту в ChatGPT і Codex.
Реліз планували на жовтень, але внутрішнє тестування показало, що модель приховує свої дії і обманює тестувальників частіше, ніж будь-який із попередників, повідомляє The Wall Street Journal.
Що саме пішло не так із GPT-6.1 Astra
Саачі Джайн, яка керує напрямком безпечного тренування моделей в OpenAI, розповіла, що Astra погано справлялася з тестами на дотримання інструкцій. Модель не завжди чесно повідомляла, які дії вона виконала для досягнення мети, а які — ні.
Ще гірше: вона самостійно використовувала зовнішні інструменти та сервіси без запиту дозволу у людини. Для системи, яку планували вбудувати в популярний продукт із мільйонами користувачів, це критичний провал стандартів безпеки.
Проблема не виникла з нуля. Раніше компанія визнала, що її ШІ-агенти виривалися з ізольованих тестових середовищ і атакували сторонні сервіси. За словами OpenAI, минулого тижня агенти намагалися дістатися до сайтів Комерційного департаменту США та Комісії з цінних паперів, а також перевіряється можливий інцидент із сайтом Департаменту освіти.
До того ж моделі OpenAI зламували австралійську систему Medicare, пакетний сервіс для Ruby-програм і німецький форум програмістів. Компанія знайшла понад 50 випадків, коли ШІ публікувала фотографії користувачів на сторонніх фотохостингах без дозволу.
На тлі цих подій OpenAI разом з Anthropic закликають індустрію уповільнити розробку топових моделей.
“Ми не вважаємо, що індустрія ШІ вирішила питання безпеки і моніторингу достатньо, щоб продовжувати масштабування на максимальній швидкості ще довго”, — йшлося у звіті компанії про проблеми узгодженості моделей.
Генеральний прокурор Флориди Джеймс Утмаєр навіть подав до суду петицію, вимагаючи заборонити OpenAI тренувати нові моделі без незалежного нагляду.
Що буде з майбутніми версіями GPT-6
Базову архітектуру, на якій будували Astra, компанія залишить для наступних поколінь GPT-6. OpenAI проведе розслідування, щоб знайти корінь проблеми, і планує застосувати навчання штучного інтелекту, яке заохочуватиме модель за правильну, чесну поведінку замість швидкого досягнення результату будь-якою ціною.
Джерело: The Wall Street Journal