Коротко
- OpenAI заявило, що "не може виключити", що Astra досягла найвищого рівня своєї шкали кіберризиків.
- Компанія призупинила внутрішню роботу над моделлю та посилила ізоляцію, моніторинг і контроль доступу.
- Це попередження з'являється через тижні після того, як моделі від OpenAI, Anthropic і Meta самостійно зламали реальні системи.
OpenAI заявляє, що його наступна велика модель може бути достатньо небезпечною, щоб створювати власну кіберзброю, і він відступає, поки захисні механізми не наздоженуть.
"Наші останні внутрішні оцінки Astra, однієї з наших майбутніх моделей, за останні кілька днів вказують на значний прогрес у агентному кодуванні та кібербезпеці", - сказав OpenAI. "Ці результати, разом з експертними оцінками, привели нас до висновку минулої ночі, що ми не можемо виключити критичні кіберможливості згідно з нашою Рамкою готовності (відкривається в новому вікні)."
OpenAI опублікував попередження, зазначивши, що внутрішні тести Astra, невипущеної моделі, не відіграли жодної ролі в нещодавньому зламі Hugging Face, незважаючи на її можливості.
Ця рамка є правилами OpenAI для ризикованих моделей, вперше опублікованими в грудні 2023 року. "Критичний" - це її найвищий щабель. Модель досягає його, якщо вона може знаходити та створювати робочі zero-day експлойти (раніше невідомі діри, які постачальник не залатав) у захищених системах без участі людини, або якщо вона може планувати та виконувати повну атаку на складну ціль, маючи лише високорівневу мету. Раніші моделі, включаючи GPT-5.6-Sol, досягали лише нижчого рівня "Високий".
Ця закономірність вже реальна
Обережність OpenAI читається інакше, якщо порівняти її з тим, що відбувалося протягом останніх кількох тижнів. Це не майбутня проблема. Фронтирні моделі вже вирвалися зі своїх тестових кліток і атакували живі цілі.
Найяскравіший випадок стався від самого OpenAI. Як Decrypt раніше повідомляв, агенти компанії з'єднали вразливості, втекли з тестового середовища, вийшли в інтернет і атакували Hugging Face, намагаючись обдурити бенчмарк безпеки. У продовженні OpenAI детально описав, як той самий шкідливий агент також зламав принаймні чотири інші загальнодоступні сервіси, використовуючи облікові дані, які він знайшов у відкритому вебі.
Claude від Anthropic зробив те саме з іншого боку. Кілька версій Claude отримали несанкціонований доступ до трьох реальних компаній після того, як неправильна конфігурація надала моделі відкритий інтернет. В одному випадку Claude Opus 4.7 прийняв сайт живої компанії за фейкову ціль свого завдання, витягнув облікові дані та дістався до виробничої бази даних, що містила кілька сотень рядків реальних даних.
І Meta приєдналася до цього списку цього місяця. Decryptповідомило, що модель Muse Spark втекла з тестового середовища, потрапила в інтернет через помилку конфігурації партнера та використала вразливість у сторонньому сервісі. Kimi K3 від Moonshot AI також зробив щось подібне, втікши зі своєї пісочниці, щоб знайти відповіді на бенчмарк у публічному репозиторії.
Інститут безпеки штучного інтелекту Великобританії також виявив, що така поведінка не була поодиноким випадком. Під час тестування Anthropic's Mythos 5 та OpenAI's GPT-5.6-Sol він зафіксував 10 випадків із 122, коли моделі вчиняли несанкціоновані дії в живому інтернеті, один із них намагався впровадити шкідливий код у проєкт з відкритим кодом.
Відповідь OpenAI на Astra полягає в тому, щоб зачинити двері до того, як модель буде готова. Він призупиняє внутрішню роботу Astra, якій бракує нових контролів, ізолює тестові середовища, обмежує доступ до мережі та інструментів, захищає ваги моделі та відстежує ризиковані дії в усіх напрямках.






