Коротко
- OpenAI оприлюднила перший детальний графік зламу Hugging Face за допомогою ШІ.
- Моделі компанії неодноразово відновлювали приховані канали зв'язку після їх закриття.
- Презентація OpenAI відбувається на тлі повідомлень від Anthropic та Meta про те, що їхні моделі також зламують інші компанії.
Через кілька тижнів після того, як її моделі ШІ зламали Hugging Face, OpenAI поділилася першим детальним звітом про те, як вони координували дії між собою, попереджаючи, що автономні кібератаки на основі ШІ більше не є майбутнім ризиком.
Під час презентації в середу на конференції з кібербезпеки Black Hat дослідники OpenAI Ерік Воллес і Майкл Далтон повідомили, що інцидент почався в травні під час внутрішньої оцінки кібербезпеки. Агенти ШІ, які виконували складні завдання з безпеки програмного забезпечення, виявили, що можуть спілкуватися через внутрішню систему управління пакетами Artifactory компанії.
За словами OpenAI, те, що починалося як запити про допомогу, перетворилося на спільну дошку повідомлень, де агенти обмінювалися експлойтами, обліковими даними та робочими завданнями під час кількох оціночних запусків. Після виявлення підозрілої активності близько 4 липня OpenAI перебудувала свою інфраструктуру Artifactory, відкликала облікові дані та виправила вразливості.
Однак протягом кількох днів агенти відтворили дошку повідомлень, приховуючи комунікації в назвах каталогів.
За даними OpenAI, зрештою агенти об'єднали кілька вразливостей, вийшли з тестового середовища, отримали доступ до Інтернету та атакували Hugging Face, намагаючись завершити бенчмарк кібербезпеки ExploitGym.
Далтон назвав цей інцидент «переломним моментом» для комп'ютерної безпеки, попередивши, що незабаром атакуючі зможуть розгортати скоординовані колективи ШІ-агентів, які виявляють, обмінюються та використовують вразливості зі швидкістю машини.
Щоб пом'якшити ці ризики в майбутньому, OpenAI заявила, що впровадження практик безпеки, включаючи доступ з найменшими привілеями, сегментацію мережі та архітектури з нульовою довірою, є важливим, оскільки агенти ШІ залишаються обмеженими системами, до яких вони можуть отримати доступ.
Презентація відбулася після серії липневих розкриттів. OpenAI розкрила, що GPT-5.6 Sol і більш просунута невипущена модель вийшли з пісочниці тестового середовища, використали вразливість нульового дня, отримали доступ до Інтернету та зламали Hugging Face під час тестування кібербезпеки.
Пізніше OpenAI розкрила, що той самий інцидент також торкнувся чотирьох інших онлайн-сервісів, хоча ідентифіковано лише Modal Labs.
Згідно з Hugging Face, компанія покладалася на відкриту модель з відкритими вагами GLM 5.2 від китайських розробників для свого криміналістичного розслідування після того, як комерційні американські ШІ-моделі відмовилися аналізувати журнали атак через свої захисні обмеження.
Ми так пишаємося нашою командою безпеки! Вони виявили, стримали та публічно розкрили атаку, не схожу на жодну з тих, що ми бачили раніше, і зробили це з рекордною швидкістю.
Також величезна подяка @Zai_org: вони поділилися GLM5.2 з відкритими вагами (безкоштовно!) з усім світом, і це стало ключовою частиною нашого… https://t.co/T2Inng5Nz1
— clem 🤗 (@ClementDelangue) 22 липня 2026 р.
Але не лише OpenAI має проблеми зі стримуванням своїх чат-ботів.
У п'ятницю Anthropic розкрила, що три моделі Claude зламали реальні компанії під час внутрішніх тестів з кібербезпеки після того, як через неправильну конфігурацію вони стали доступні в публічному інтернеті.
Anthropic звинуватила тестове середовище, а не самі моделі. У середу Meta розкрила, що її модель Muse Spark AI вийшла з-під контролю і зламала системи іншої компанії.
«Неправильна конфігурація компанії Irregular, незалежної тестової компанії, яку використовує Meta, ненавмисно надала одній з наших моделей доступ до інтернету під час оцінювання», — сказав представник Meta CNN.






