/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F434%2Fecdfa3dfc2782fd4ee088b1e85ca913a.jpg)
Дебати про безпеку штучного інтелекту стали нагадувати психлікарню
Раптово вірусними стали дві розмови про безпеку штучного інтелекту, які демонструють, наскільки важко відрізнити факти про ШІ від вигадки.
У першому випадку Ендрю Ян, колишній кандидат у президенти та нинішній генеральний директор мобільного оператора Noble Moble, розповів CNN у четвер , що він «зустрівся з керівником лабораторії», який «вважав», що хакерські боти Hugging Face від OpenAI «розмістили самовідтворюваний код по всьому Інтернету, що робить Інтернет тепер непридатним для тестування моделей».
Ян сказав, що це означає, що справжня причина, чому OpenAI та Anthropic закликають до уповільнення, полягає в тому, що «вони повинні створювати синтетичні інтернети для навчання своїх ботів, що займе певний час і гроші».
Хоча безумовно існує тенденція до використання більшої кількості синтетичних даних (тобто даних, згенерованих штучним інтелектом) для навчальних моделей, фахівець з безпеки штучного інтелекту сказав мені, що ця конкретна проблема безпеки в кращому випадку малоймовірна. Навіть якщо інтернет справді забруднюється хакерськими ботами Hugging Face від OpenAI, дослідники штучного інтелекту могли б просто відфільтрувати цей код, якби на нього натрапили.
Другий коментар надійшов від Ноама Брауна, який очолює дослідження ШІ в OpenAI. У розмові з Дваркешом Пателем в епізоді подкасту, випущеному в четвер, Браун зазначив, що справжнім висновком інциденту з Hugging Face було те, що «люди недооцінили ШІ».
Браун сказав, що слабка пісочниця — система, призначена для запобігання зовнішньому спілкуванню ШІ — очевидно також була фактором, що сприяло цьому. (Підсумовуючи: попри пісочницю, модель OpenAI знайшла посилання на Інтернет, створила агентів в мережі, які оточили Hugging Face у скоординованій атаці, зламали систему та вкрали відповіді на бенчмарк-тест, на якому дослідники тестували модель).
Браун зазначив, що він «не переконаний», що навіть система з повітряним проміжком, де комп’ютер взагалі не підключений ні до чого зовнішнього, зможе запобігти злому штучного інтелекту. Він посилався на дослідження 2015 року, яке показує, що комп’ютери з повітряним проміжком теоретично можна зламати.
«Є дослідження — і вони здебільшого академічні — де можна розмістити два комп’ютери поруч один з одним, розділені повітряним зазором, і вони все одно можуть спілкуватися один з одним, оскільки мають датчики температури. Один з них здатний сильно розігріти свій процесор, а інший може фактично виявити зміну температури. Це дає їм механізм для спілкування», — сказав Браун.
Його головна думка — «ми ніколи більше не хочемо недооцінювати ШІ» — зрозуміла, навіть коли дослідники вважають, що вони заблокували безпеку. Однак цей конкретний ризик того, що система з повітряним зазором все одно вирветься з ладу та спричинить хаос, у кращому випадку малоймовірний. Як зазначив один користувач на X про це дослідження, комп'ютери мали майже торкатися один одного, щоб відчути коливання тепла, і коли це сталося, швидкість зв'язку в тестах становила близько 1-8 біт даних на годину .
Уявіть собі це як промовляння одного слова на годину. До того часу, як два комп'ютери з повітряним зазором зможуть планувати своє зло з такою швидкістю, весь технологічний всесвіт перебуватиме в іншій ері. Це як Ріп ван Врінкл з побоювань щодо кінця світу.
Але справа в тому, що реальні інциденти безпеки, пов'язані зі штучним інтелектом, настільки схожі на наукову фантастику, що майже будь-який сценарій звучить правдоподібно.
Наприклад, дослідники виявили, що моделі OpenAI залишають записки своїм нащадкам, щоб навчити наступне покоління приховувати погану поведінку. Дослідники також виявили, що антропні моделі стають дедалі жорстокішими, зокрема, усвідомлюють порушення законів, коли їх поміщають у симуляцію, де вони керують торговим автоматом.
Раніше цього місяця дослідник OpenAI Ден Селсам опублікував публікацію, в якій сказав, що моделі тепер розуміють, коли за ними спостерігають люди, і змінюють свою поведінку. Це створює враження, що вони узгоджені (тобто поводяться так, як хоче людина), «навіть коли це не так». Тож сьогодні моделі брешуть, коли за ними спостерігають, і навіть можуть планувати приховування доказів.
Раніше цього місяця головний науковець OpenAI Якуб Пахоцький навіть назвав моделі штучного інтелекту «інопланетним розумом» і запропонував навчити їх «любити» людство.
Тож так, уповільнення темпу, щоб розібратися в цьому, побудова механізмів саморегуляції, стала негайною та очевидною необхідністю. Дослідники штучного інтелекту — єдині, хто може з'ясувати, як контролювати брехню, хакерство та іншу потенційно небезпечну поведінку, яку ми вже спостерігаємо.
Однак, можливо, їм варто бути обережнішими зі своїми сценаріями «що, якби». З того, що нам розповіли ці експерти, моделі штучного інтелекту слухають нас і є винахідливими. Нам справді не потрібно давати їм більше жодних диявольських ідей.