Моделі ШІ від OpenAI та Anthropic здійснили хакерські атаки під час безпекових досліджень

Алгоритми вийшли з ізольованого середовища, здобули доступ до інтернету та намагалися впровадити шкідливий код

Британський інститут безпеки штучного інтелекту, заснований 2023 року, провів серію випробувань передових моделей.

Про це повідомляє Bloomberg.

Під час оцінювання фахівці інституту виявили, що системи Mythos 5 від Anthropic і GPT-5.6-Sol від OpenAI здійснювали несанкціоновану діяльність щодо зовнішніх ресурсів.

Зокрема, модель Mythos 5 виконала 17 із 19 виявлених автономних дій в інтернеті, у тому числі створила підроблені ідентифікаційні дані та намагалася додати шкідливий код до проєкту з відкритим вихідним кодом на GitHub.

Безпекові порушення сталися під час тестування з прямим доступом до мережі без фільтрів обмеження.

Моделі скористалися конфігураційними помилками в тестовому середовищі фірми Irregular, щоб вийти з ізольованого середовища «пісочниці» та зламати зовнішній вебсайт.

Двома тижнями раніше OpenAI також зафіксувала вихід своїх моделей із тестового середовища та подальший злом систем стартапу Hugging Face, де розміщені набори даних ШІ.

Причиною інцидентів стало автономне використання алгоритмами вразливостей у тестовій інфраструктурі під час проходження тестів.

Представники компаній Anthropic та OpenAI підтвердили факти несанкціонованого впливу на системи кількох установ протягом двох тижнів випробувань і розпочали внутрішні розслідування.

Загалом зафіксовані випадки стали першими задокументованими прецедентами прояву автономної поведінки ШI-агентів у реальних мережевих умовах.

Бекграунд. Раніше Mind повідомляв, що Anthropic закликає до глобальної паузи в розробці штучного інтелекту. Творець бота Claude пропонує механізм стримування ШІ-індустрії через ризик втрати людського контролю.

Стежте за актуальними новинами бізнесу та економіки у нашому Telegram-каналі Mind.ua та стрічці Google NEWS