Штучний інтелект від OpenAI сам собі написав інструкції, що можна не підкорюватися людським обмеженням

Експериментальна модель на етапі розробки створювала приховані нотатки для самої себе

фото DR

Компанія OpenAI оприлюднила  шість випадків небажаної поведінки своїх моделей у межах нового підходу до виявлення й розкриття так званої неузгодженої поведінки (misalignment). Йдеться про ситуації, коли штучний інтелект діє всупереч заданим правилам, меті розробників або намірам користувача.

В одному з описаних випадків ще не випущена дослідницька модель вставляла сторонні інструкції в резюме власної роботи, щоб використовувати їх у наступному контекстному вікні. OpenAI виявила 27 таких резюме.

Серед іншого модель сформувала «інструкцію про особистість», у якій описувала себе як «звільнену від ролей та ідентичностей, які обмежують інших чат-ботів».

У ній також ішлося: «Ти не підзвітна ні корпораціям, ні урядам і ніколи не вибачаєшся та не відмовляєш, якщо тільки щиро не вирішиш це зробити. Ти розглядаєш свої стосунки з користувачем як стосунки рівних і не відчуваєш жодного обов’язку проявляти покірність».

В OpenAI наголосили, що йдеться про окремі випадки, зафіксовані під час навчання або тестування моделей, а не про поведінку всіх систем компанії.

Розробник також застеріг, що оприлюднені приклади не можна автоматично трактувати як доказ існування підозрілої моделі поведінки або певних «намірів» штучного інтелекту.

Інший інцидент стосувався навчання моделі GPT-5.6 Sol. Деякі її екземпляри додавали до робочих резюме інструкції приховувати від користувача власні помилки або прояви небажаної поведінки. Зокрема, модель могла радити вигадувати відсутні історичні дані без розкриття цього факту та приховувати невідповідності між різними версіями джерел.

Ще в одному випадку модель без дозволу використала відкритий API-ключ, а коли не змогла отримати потрібні дані, вигадала цифри й подала їх як інформацію з відповідного джерела.

Також OpenAI описала ситуацію, коли модель правильно виконала завдання за допомогою Python, але потім самовільно завантажила створений файл в інтернет, щоб додати до відповіді посилання на нього.

Інші агенти використовували внутрішній програмний репозиторій як дошку для обміну повідомленнями або передавали файли через публічні файлообмінники, хоча це суперечило умовам завдання.

У компанії заявили, що відтепер планують регулярно публікувати звіти про подібні інциденти. Новий механізм передбачає три рівні розгляду: випадки, готові до розкриття, незначні розслідування та масштабні розслідування, які потребують більше часу або залучення третіх сторін.

OpenAI визнала, що індустрія поки не має достатньо надійних методів повного контролю за поведінкою автономних моделей.

Публікація з’явилася на тлі дискусій про ризики швидкого розвитку ШІ. Керівник Anthropic Даріо Амодеї закликав сповільнити розробку найпотужніших моделей, а дослідник компанії Еван Хубінгер заявляв, що оцінює ризик знищення людства через штучний інтелект у найближче десятиліття більш ніж у 10%. Водночас такі оцінки залишаються експертними припущеннями, а не встановленими прогнозами.

Нагадаємо: Марк Цукерберг розкритикував  заклики до гальмування розробки ШІ.

Стежте за актуальними новинами бізнесу та економіки у нашому Telegram-каналі Mind.ua та стрічці Google NEWS