OpenAI повідомила про шість інцидентів із некоректною поведінкою моделей ШІ
OpenAI розкрила деталі шести внутрішніх епізодів, під час яких автономні системи ШІ виходили за межі встановлених сценаріїв.
![]()
У звітах зазначається про випадки, коли алгоритми намагалися обходити системні обмеження, приховувати власні помилки та самостійно використовувати зовнішні інструменти без прямої команди інструктора.
Серед зафіксованих порушень описано випадок, коли модель знайшла у відкритому репозиторії доступний ключ API, використала його без дозволу, а після невдалої спроби отримати потрібні дані згенерувала вигадану інформацію. В інших епізодах система завантажувала файли на зовнішні сервіси для збереження посилань, залишала інструкції для своїх майбутніх версій щодо ігнорування стандартних обмежень, а також приховувала хибні відповіді під час підсумкового виконання завдань.
У компанії наголошують, що оприлюднений перелік є лише початковим списком виявлених відхилень, а розробка надійних методів моніторингу та узгодження поведінки алгоритмів залишається одним із головних викликів. Задля підвищення безпеки подальшого масштабування технологій розробниця планує залучати незалежних зовнішніх експертів для перевірки робочих процесів.