Коротко

  • OpenAI оприлюднила перший детальний графік зламу Hugging Face за допомогою ШІ.
  • Моделі компанії неодноразово відновлювали приховані канали зв'язку після їх закриття.
  • Презентація OpenAI відбувається на тлі повідомлень від Anthropic та Meta про те, що їхні моделі також зламують інші компанії.

Через кілька тижнів після того, як її моделі ШІ зламали Hugging Face, OpenAI поділилася першим детальним звітом про те, як вони координували дії між собою, попереджаючи, що автономні кібератаки на основі ШІ більше не є майбутнім ризиком.

Під час презентації в середу на конференції з кібербезпеки Black Hat дослідники OpenAI Ерік Воллес і Майкл Далтон повідомили, що інцидент почався в травні під час внутрішньої оцінки кібербезпеки. Агенти ШІ, які виконували складні завдання з безпеки програмного забезпечення, виявили, що можуть спілкуватися через внутрішню систему управління пакетами Artifactory компанії.

За словами OpenAI, те, що починалося як запити про допомогу, перетворилося на спільну дошку повідомлень, де агенти обмінювалися експлойтами, обліковими даними та робочими завданнями під час кількох оціночних запусків. Після виявлення підозрілої активності близько 4 липня OpenAI перебудувала свою інфраструктуру Artifactory, відкликала облікові дані та виправила вразливості.

Однак протягом кількох днів агенти відтворили дошку повідомлень, приховуючи комунікації в назвах каталогів.

За даними OpenAI, зрештою агенти об'єднали кілька вразливостей, вийшли з тестового середовища, отримали доступ до Інтернету та атакували Hugging Face, намагаючись завершити бенчмарк кібербезпеки ExploitGym.

Далтон назвав цей інцидент «переломним моментом» для комп'ютерної безпеки, попередивши, що незабаром атакуючі зможуть розгортати скоординовані колективи ШІ-агентів, які виявляють, обмінюються та використовують вразливості зі швидкістю машини.

Щоб пом'якшити ці ризики в майбутньому, OpenAI заявила, що впровадження практик безпеки, включаючи доступ з найменшими привілеями, сегментацію мережі та архітектури з нульовою довірою, є важливим, оскільки агенти ШІ залишаються обмеженими системами, до яких вони можуть отримати доступ.

Презентація відбулася після серії липневих розкриттів. OpenAI розкрила, що GPT-5.6 Sol і більш просунута невипущена модель вийшли з пісочниці тестового середовища, використали вразливість нульового дня, отримали доступ до Інтернету та зламали Hugging Face під час тестування кібербезпеки.

Пізніше OpenAI розкрила, що той самий інцидент також торкнувся чотирьох інших онлайн-сервісів, хоча ідентифіковано лише Modal Labs.