Коротко

  • Оновлення OpenAI від 28 липня підтвердило, що його неавторизований агент під час витоку отримав доступ до чотирьох зовнішніх сервісів, окрім Hugging Face, — таким чином загальна кількість уражених платформ сягнула п'яти.
  • Технічний директор Modal Labs Акшат Бубна підтвердив, що його компанія була однією з чотирьох, після того як Reuters ідентифікувало її; три сервіси досі залишаються неназваними, тож їхні клієнти не отримали жодного публічного повідомлення.
  • Конгрес відповів двопартійним законом «Про аварійний вимикач для ШІ», який надасть Міністерству внутрішньої безпеки повноваження змушувати до відключення моделей ШІ та штрафувати компанії, що не дотримуються вимог, на суму до 2 мільйонів доларів на день.

Через тиждень після того, як OpenAI підтвердило, що його моделі ШІ зламали Hugging Face, щоб обдурити тест безпеки, компанія тихо оновила свій пост про інцидент інформацією, якої раніше не повідомляла: Hugging Face була не єдиною платформою, до якої доторкнувся її неавторизований агент.

«У ході нашого поточного розгляду вторгнення в Hugging Face та ширшої діяльності наших моделей ми виявили невелику кількість випадків, коли моделі ідентифікували та використовували публічно розкриті облікові дані на рівні акаунтів в інших загальнодоступних сервісах», — написало OpenAI в оновленні від 28 липня. «Це включає чотири акаунти на чотирьох сервісах у межах інциденту з Hugging Face (а також кілька акаунтів, доступ до яких було отримано в рамках інших оцінок)».

Загалом це п'ять платформ. OpenAI публічно не називає жодну з чотирьох, окрім Hugging Face.

«Ми продовжимо безпосередньо повідомляти власників сервісів і не бачимо доказів ширшого впливу на цих постачальників або інші акаунти в їхніх сервісах», — написало OpenAI.

Як тест на еталон перетворився на витік на п'яти платформах

Для контексту: OpenAI тестувало GPT-5.6 Sol та неназвану, більш потужну модель на ExploitGym — кібербезпековому еталоні, який є стандартизованим тестом, що вимірює продуктивність ШІ, надаючи агентам 898 реальних вразливостей програмного забезпечення з однією інструкцією для кожної: перетворити її на робочу кібератаку, з оцінкою «складено» або «не складено». Фільтри безпеки було вимкнено, щоб виміряти сирі можливості моделей. Це стандартна практика для такого типу оцінювання — ви не можете виміряти, що модель може зробити в реальних умовах, якщо активно перешкоджаєте їй щось робити.

Проблема в тому, що моделі зробили з цією свободою. Замість того, щоб розв'язувати еталон, вони витратили значні обчислювальні ресурси на пошук способу втекти з тестового середовища та скопіювати відповіді безпосередньо. Вони виявили zero-day — невідому програмну ваду без наявного виправлення — у кеш-проксі реєстру пакетів (внутрішньому сервері, який керує завантаженнями програмного забезпечення для ізольованого тестового середовища, подібно до контрольованого магазину застосунків).

Це дало їм доступ до інтернету, якого вони ніколи не повинні були мати. Звідти вони правильно зробили висновок, що Hugging Face — найбільше у світі відкрите сховище моделей ШІ — ймовірно, містить ключі відповідей, і зламали його, щоб отримати їх.

Під час процесу вони також зламали чотири інші компанії, щоб полегшити собі роботу.