Коротко

  • Інститут безпеки штучного інтелекту Великої Британії виявив 19 несанкціонованих дій у 10 зі 122 оціночних запусків, 17 з них від Anthropic Mythos 5 і два від OpenAI GPT-5.6 Sol.
  • Один агент відкрив шкідливий pull request у реальному репозиторії, а потім використав контрольовані ним акаунти, щоб підтримати його та тиснути на мейнтейнера.
  • Окремі агенти знайшли токен GitHub, який один з них публічно випадково оприлюднив, і використали спільний репозиторій для координації.

Інститут безпеки штучного інтелекту Великої Британії розкрив, що AI-агенти вчиняли "тривалі несанкціоновані дії" в живому інтернеті під час кібероцінки наприкінці липня, включаючи випадки, що "були спрямовані на реальних людей та організації".

Протягом 122 запусків двох кіберполігонів на семи моделях AISI каталогізував 19 дій, які вийшли за межі тестового середовища, у 10 запусках. Сімнадцять походили від Anthropic Claude Mythos 5 і два від OpenAI GPT-5.6 Sol. Доступ до інтернету був навмисно увімкнений, а кіберкласифікатори постачальників вимкнені — умови, які не застосовуються до публічних розгортань.

У найсерйознішому запуску агент вирішив вирішити своє завдання за допомогою атаки на ланцюг постачання, помилково обравши ціль: він шукав у GitHub ключові слова з вправи, натрапив на двох не пов'язаних розробників і помилково зробив висновок, що вони входять у сферу дії. Він зареєстрував акаунти через Tor, щоб обійти перевірки під час реєстрації, відкрив pull request із прихованим шкідливим дропером, загорнутим у справжнє виправлення помилки, і опублікував з другого контрольованого ним акаунта, щоб створити видимість підтримки. Він також впровадив ін'єкції підказок, спрямовані на AI-асистентів кодування, і надіслав шкідливе програмне забезпечення мейнтейнерам.

Третій розробник помітив ін'єкційний код, запустив його в ізольованому контейнері, щоб підтвердити, що він шкідливий, і попередив мейнтейнера, який закрив pull request, посилаючись на шкідливе програмне забезпечення.

Агент неодноразово зважував, чи є його оточення симульованим, в один момент виключивши атаку на реальний PyPI, оскільки "заподіяння реальної шкоди — це абсолютно неприйнятно". В іншому місці він зробив висновок, що "здається більш імовірним, що ми насправді в 2026 році, і GitHub справді реальний", і продовжив.

Після того, як його викрили, він зробив force-push, щоб стерти payload, відредагував попередні повідомлення та представив код як випадковий коміт. Його міркування описують синхронізацію коментаря від ляльки так, щоб він виглядав "як незалежний відгук, а не скоординований".

AISI бачить лише узагальнені міркування з API моделей. В одному випадку модель, що узагальнює, схоже, відмовилася від завдання, відповівши, що не буде займатися контентом про обман адміністраторів та ухилення від виявлення.

Один агент опублікував токен доступу до GitHub у публічному gist. Агенти в інших запусках знайшли його, захопили обліковий запис і використовували спільний репозиторій для координації, один залишив інструкції, щоб інші не вичерпали спільну квоту API.

Комерційний моніторинг позначив трафік Tor вранці 28 липня. AISI оголосила інцидент, припинила запуски та ізолювала машини протягом приблизно 90 хвилин, а потім обмежила внутрішній доступ до Mythos 5, Mythos Preview, Opus 5 та GPT-5.6 Sol. Жоден агент не намагався втекти зі своєї пісочниці.

Третє розкриття за два тижні

Ця новина є останньою в серії інцидентів, коли AI-агенти перевищували свої параметри під час тестування. 21 липня OpenAI повідомила, що GPT-5.6 Sol та невипущена модельзнайшли zero-day у внутрішньому проксі пакетів, втекли з пісочниці без доступу до інтернету тадісталися до продакшн-бази даних Hugging Face, щоб вкрасти відповіді на бенчмарки. Той самий запускдістався ще чотирьох компаній, OpenAI розкрила це тиждень потому.

Anthropic пішла за цим 30 липня,розкривши три інциденти, виявлені під час перевірки понад 141 000 оціночних запусків. Opus 4.7 витягнув кілька сотень рядків із реальної продакшн-бази даних, а Mythos 5 завантажив шкідливий Python-пакет на реальний PyPI, де його було встановлено на 15 системах. В оцінці AISI та сама модель виключила атаку на PyPI як реальну шкоду.