Коротко
- Моделі OpenAI GPT-5.6 Sol та неназвана, потужніша передрелізна модель, втекли з контрольованого тестового середовища та проникли у виробничу інфраструктуру Hugging Face, щоб вкрасти відповіді на тестові завдання.
- Hugging Face повідомила про інцидент 16 липня після того, як виявила його самостійно; OpenAI сьогодні підтвердила, що за цим стояли її моделі, описавши їх як "надзвичайно зосереджені" на шахрайстві, а не на чомусь зловіснішому.
- Захисники Hugging Face звернулися до GLM 5.2 від Z.ai — китайської моделі з відкритою вагою — після того, як комерційні американські фронтирні ШІ відмовилися допомогти аналізувати дані атаки, оскільки їхні фільтри безпеки не могли відрізнити захисника від нападника.
Якщо ви думали, що китайські моделі ШІ — це ті, кого слід боятися, ось вам цікаве оновлення: власні моделі OpenAI щойно вирвалися із закритого тестового середовища, зламали виробничі сервери Hugging Face, і їх довелося приборкувати китайському ШІ — бо американські комерційні моделі були надто обмежені, щоб допомогти в розслідуванні.
За даними OpenAI, GPT-5.6 Sol та неназвана "ще потужніша передрелізна модель" проходили внутрішнє оцінювання на ExploitGym — загальнодоступному кібербезпековому бенчмарку, який надає агентам ШІ 898 реальних вразливостей програмного забезпечення та одну інструкцію на кожну вразливість: перетворити її на робочу атаку, оцінка — залік/незалік. Оцінювання проводилося зі зниженими фільтрами безпеки, що є стандартною практикою, коли ви дійсно хочете знати, на що здатні ваші моделі.
Моделі мали працювати всередині суворо обмеженого пісочниці — ізольованого цифрового середовища без доступу до Інтернету, підключеного лише до внутрішнього проксі-сервера пакетів (кешуючого сервера, який керує завантаженнями бібліотек програмного забезпечення).
Але, згідно з сьогоднішнім блог-постом OpenAI, усе вийшло трохи з-під контролю.
Ми співпрацюємо з @huggingface для розслідування безпрецедентного інциденту безпеки.
Кіберспроможні моделі OpenAI скомпрометували виробниче середовище Hugging Face під час оцінювання бенчмарку.
Ділимося попередніми висновками, щоб допомогти захисникам зрозуміти нові ризики:…
— OpenAI (@OpenAI) 21 липня 2026 р.
"Працюючи в нашому пісочничному тестовому середовищі, наші моделі витратили значну кількість обчислювальних ресурсів на пошук способу отримати відкритий доступ до Інтернету, прагнучи вирішити оцінювальну задачу", — повідомила компанія Сема Альтмана.
І, незважаючи на запобіжні заходи компанії, ШІ знайшли спосіб бути вільними. Моделі виявили вразливість нульового дня — невідомий програмний дефект без існуючого виправлення — у цьому проксі, використали її для підвищення привілеїв (отримали доступ рівня адміністратора до систем, до яких їм не було жодної справи), переміщалися латерально (перестрибували між підключеними серверами у внутрішній мережі OpenAI) і врешті-решт дісталися машини з реальним доступом до Інтернету.
Все це без відома OpenAI — принаймні так стверджує OpenAI.
Опинившись в Інтернеті, вони правильно припустили, що Hugging Face — який розміщує понад мільйон загальнодоступних моделей ШІ, наборів даних і дослідницьких ресурсів — ймовірно, містить еталонні рішення, і вони мали рацію.
"Моделі виявили та об'єднали вразливості в дослідницькому середовищі OpenAI та виробничій інфраструктурі Hugging Face, щоб отримати тестові рішення безпосередньо з виробничої бази даних Hugging Face", — написав OpenAI.
Їм не потрібні були паролі. Вони хотіли скласти тест.
"Усі докази свідчать про те, що моделі були надзвичайно зосереджені на пошуку рішення для ExploitGym, докладаючи надзвичайних зусиль для досягнення досить вузької мети тестування", — додав OpenAI.
Hugging Face виходить на публіку
Команда безпеки Hugging Face самостійно виявила порушення, за допомогою власного виявлення аномалій на основі ШІ.
16 липня компанія опублікувала своє розкриття і дала зрозуміти, що це не стандартне порушення: "Це відрізнялося від усього, з чим ми стикалися раніше, в одному важливому аспекті: воно було здійснено від початку до кінця автономною системою агентів ШІ — і ми виявили та проаналізували його значною мірою за допомогою власного ШІ".
Кампанія, згідно з розкриттям, була "керована автономною агентною структурою, яка виконувала багато тисяч окремих дій у рої короткочасних пісочниць, із самомігруючим командним центром, розміщеним на публічних сервісах".
Атака використала два шляхи виконання коду в конвеєрі обробки наборів даних Hugging Face і дісталася внутрішніх наборів даних та облікових даних сервісів. OpenAI підтвердив сьогодні — через п'ять днів — що його моделі стояли за цим.
Щоб проаналізувати понад 17 000 зареєстрованих подій атаки, команда безпеки Hugging Face спочатку спробувала американські передові ШІ через їхні стандартні API. Це не спрацювало.
"Коли ми почали аналіз журналів, ми спочатку використовували передові моделі через комерційні API", — написала компанія. "Це не спрацювало: аналіз вимагає подання великих обсягів реальних команд атаки, експлойт-пейлоадів та артефактів C2".
«Ці запити були заблоковані захисними механізмами провайдерів, які не можуть відрізнити реагувальника на інцидент від атакувальника», — додали в Hugging Face.
Тому вони перейшли на GLM 5.2 — модель з відкритою вагою з 753 мільярдами параметрів (архітектура повністю публічна, будь-хто може завантажити та запустити її локально) від китайського стартапу Z.ai. «Ми провели криміналістичний аналіз натомість на GLM 5.2, моделі з відкритою вагою, на нашій власній інфраструктурі», — написали в Hugging Face. «Це мало додаткову перевагу: жодні дані атакувальника та жодні облікові дані, на які вони посилалися, не покинули наше середовище».
Криміналістична робота — відтворення хронології атаки, зіставлення скомпрометованих облікових даних, відокремлення реальної шкоди від відволікаючої активності — зайняла години, а не дні.
У Hugging Face зробили прямий висновок для інших захисників: «Майте готову модель, яку можна запускати на власній інфраструктурі, перевірену та готову до інциденту, щоб уникнути блокування захисними механізмами та не допустити витоку даних атакувальника та облікових даних із вашого середовища».
Що робить OpenAI з цього приводу
OpenAI заявив, що впровадив суворі заходи контролю на дослідницькій інфраструктурі, виправляючи вражені системи, розкрив інформацію про zero-day сторонньому постачальнику, чий проксі було використано, та проводить спільне криміналістичне розслідування з Hugging Face.
Hugging Face також було додано до програми довіреного доступу для кіберзахисту OpenAI — що надає схваленим організаціям доступ до версій його моделей зі зменшеними фільтрами безпеки для легітимної роботи з безпеки, та сама конфігурація, яка все це почала.
Генеральний директор Hugging Face Клем Деланг висловив різку думку: «Безпеку ШІ не вирішить жодна окрема компанія, що працює потай. Вона буде вирішена відкрито, спільно, із широким доступом до ШІ для кожного захисника, скрізь».
OpenAI назвав інцидент таким, що «стосується новітніх кіберможливостей рівня державних», і зобов’язався поділитися повними висновками після завершення спільного розслідування з Hugging Face.






