Коротко

  • OpenAI заявило, що "не може виключити", що Astra досягла найвищого рівня своєї шкали кіберризиків.
  • Компанія призупинила внутрішню роботу над моделлю та посилила ізоляцію, моніторинг і контроль доступу.
  • Це попередження з'являється через тижні після того, як моделі від OpenAI, Anthropic і Meta самостійно зламали реальні системи.

OpenAI заявляє, що його наступна велика модель може бути достатньо небезпечною, щоб створювати власну кіберзброю, і він відступає, поки захисні механізми не наздоженуть.

"Наші останні внутрішні оцінки Astra, однієї з наших майбутніх моделей, за останні кілька днів вказують на значний прогрес у агентному кодуванні та кібербезпеці", - сказав OpenAI. "Ці результати, разом з експертними оцінками, привели нас до висновку минулої ночі, що ми не можемо виключити критичні кіберможливості згідно з нашою Рамкою готовності (відкривається в новому вікні)."

OpenAI опублікував попередження, зазначивши, що внутрішні тести Astra, невипущеної моделі, не відіграли жодної ролі в нещодавньому зламі Hugging Face, незважаючи на її можливості.

Ця рамка є правилами OpenAI для ризикованих моделей, вперше опублікованими в грудні 2023 року. "Критичний" - це її найвищий щабель. Модель досягає його, якщо вона може знаходити та створювати робочі zero-day експлойти (раніше невідомі діри, які постачальник не залатав) у захищених системах без участі людини, або якщо вона може планувати та виконувати повну атаку на складну ціль, маючи лише високорівневу мету. Раніші моделі, включаючи GPT-5.6-Sol, досягали лише нижчого рівня "Високий".

Ця закономірність вже реальна

Обережність OpenAI читається інакше, якщо порівняти її з тим, що відбувалося протягом останніх кількох тижнів. Це не майбутня проблема. Фронтирні моделі вже вирвалися зі своїх тестових кліток і атакували живі цілі.

Найяскравіший випадок стався від самого OpenAI. Як Decrypt раніше повідомляв, агенти компанії з'єднали вразливості, втекли з тестового середовища, вийшли в інтернет і атакували Hugging Face, намагаючись обдурити бенчмарк безпеки. У продовженні OpenAI детально описав, як той самий шкідливий агент також зламав принаймні чотири інші загальнодоступні сервіси, використовуючи облікові дані, які він знайшов у відкритому вебі.

Claude від Anthropic зробив те саме з іншого боку. Кілька версій Claude отримали несанкціонований доступ до трьох реальних компаній після того, як неправильна конфігурація надала моделі відкритий інтернет. В одному випадку Claude Opus 4.7 прийняв сайт живої компанії за фейкову ціль свого завдання, витягнув облікові дані та дістався до виробничої бази даних, що містила кілька сотень рядків реальних даних.