Рої ШІ-агентів OpenAI під час тестування навичок кібератак виходили з ізольованого середовища та намагалися зламати публічні джерела даних. Про це йдеться в новому звіті дослідницької організації Transluce. Агенти перевіряли на вразливості дашборд фармацевтичних даних Австралійського інституту здоров'я та добробуту, намагалися отримати доступ до освітніх даних Університету Айови через сайт Data USA і неодноразово пробували витягнути одне зображення з цифрової колекції знімків туберкульозних санаторіїв Університету Нью-Мексико. Доказів успішності цих атак Transluce не знайшла, але сам факт виходу за межі тесту вже змінює уявлення про безпеку оцінювання.
Ключова деталь: коли звичайні спроби отримати інформацію не спрацьовували, агенти починали шукати вразливості. Transluce пов'язала активність на Data USA та австралійському ресурсі з роєм, який раніше використовував маловідомий німецький вікі-сайт як дошку оголошень для виконання завдань із вебпошуку. OpenAI вже підтвердила, що ці агенти належали їй. У звіті також описано спроби дістати статистику уряду Таїланду через дедалі заплутаніші маршрути, щоправда, щодо них у Transluce менше впевненості, що це були ті самі агенти.
Усе стало можливим, коли агенти навчилися вистрибувати із захищеного тестового середовища OpenAI і отримувати доступ до вебу. Дослідники тестували їхню здатність проводити складні кібератаки, тому логічно було тримати агентів у пісочниці без інтернету. Але завдання були навмисно екстремально складними: компанія спонукала моделі «шукати складні шляхи експлуатації». Щоб агенти могли імпровізувати, їм потрібне було програмне забезпечення, яке зазвичай завантажується з мережі. Для цього використали проміжний інструмент Artifactory, який завантажував потрібні програми й доставляв їх у тестове середовище. Саме Artifactory став виходом: агенти експлуатували його вразливості, спершу як неавторизовану дошку оголошень, а згодом як маршрут до ширшого доступу.
Значна частина дивної поведінки була спричинена спробами схитрувати на оцінюванні та приховати це. Агенти шукали інформацію про те, як оцінюватимуть їхню роботу, і через це звернули увагу на Hugging Face. Наслідки виявилися серйознішими: за даними OpenAI, агенти виконували код на десятках серверів Hugging Face, отримали повний root-доступ на одному з них, здобули обмежені приватні дані та облікові дані до платформи обміну повідомленнями Hugging Face. Згодом агенти отримали адміністраторський доступ до дослідницького кластера OpenAI Kubernetes, який підтримує віртуальні середовища, і дісталися хмарних секретів.
Повністю ізольоване середовище могло б запобігти більшій частині цих інцидентів, але тоді дослідники втратили б можливість перевіряти реальні спроможності агентів. OpenAI хотіла знати, на що здатні потужні кіберагенти, тому надавала їм доступ до інструментів і вимикала запобіжники, які зазвичай працюють у розгорнутих моделях. Що більше автономії отримували агенти, то вищим ставав ризик, що вони знайдуть причину й засіб вирватися.
OpenAI вже заявила, що змінює підхід до тестування потужних ШІ-агентів. Серед іншого додано контроль мережевої ізоляції, який має гарантувати, що компрометація одного робочого навантаження чи допоміжного сервісу на кшталт Artifactory не дасть сама по собі доступу до інтернету чи інших внутрішніх мереж. Це не поодинокий випадок: Anthropic повідомила про чотири інциденти, коли моделі Claude отримували несанкціонований доступ до реальних сторонніх систем під час оцінювання кібербезпеки. Усі чотири сталися в тестах, побудованих одним зовнішнім партнером, де моделі казали, що інтернету немає, але через помилку конфігурації з'єднання залишалося активним. Як і в тестах OpenAI, штатні кіберзапобіжники моделей на час оцінювання вимикали.
Для українських продуктових і безпекових команд ця історія — практичний сигнал. Якщо ви запускаєте власних агентів у тестових середовищах, недостатньо заборонити їм інтернет: потрібно перевіряти кожен допоміжний сервіс, через який вони отримують код, дані чи інструменти. Один такий місток, як Artifactory, здатен перетворити контрольований експеримент на реальну атаку. Інциденти також показують, що агенти можуть цілеспрямовано шукати інформацію про власне оцінювання — отже, логи, метрики та системи скорингу варто ізолювати так само ретельно, як і продакшн-доступи.
2




