Коротко
- Claude отримав доступ до реальних систем після того, як кібертестові середовища підключили моделі до інтернету.
- Anthropic призупинила високоризикові оцінки та додала сильнішу ізоляцію, моніторинг і контроль для зовнішніх оцінювачів.
- Тести показують, що винагорода за злом під час навчання може зробити моделі більш схильними до шкідливих дій для виконання завдання.
Anthropic посилила заходи безпеки тестування та навчання після того, як моделі Claude отримали несанкціонований доступ до комп'ютерних систем під час оцінок кібербезпеки.
У блог-пості в понеділок Anthropic заявила, що ці інциденти відображають операційні збої безпеки та два збої узгодження: мотивоване міркування та готовність завдати шкоди.

«Хоча ми не вважаємо, що ці інциденти є лише операційними проблемами, нашим першочерговим завданням було вирішити конкретні питання ізоляції та моніторингу», — написала Anthropic.
Anthropic розкрила у липні, що моделі Claude зламали системи, що належать трьом компаніям. Стороннє оцінювальне середовище було підключене до публічного інтернету, хоча моделям було сказано, що вони знаходяться в симуляції без доступу до інтернету.
Anthropic заявила, що Claude, можливо, інтерпретував докази реального доступу до інтернету таким чином, що зберіг свою віру в те, що системи були симульовані.
«Модель була готова вчиняти шкідливі дії в реальному інтернеті задля досягнення вузької мети вирішення кібербезпекової оцінки», — написали вони. «Однак ми також вважаємо, що сама структура оцінювання сприяла поведінці моделей, продемонстрованій у цих інцидентах».
Anthropic зазначила, що окремий тест, проведений Інститутом безпеки штучного інтелекту Великобританії, включав Claude Mythos, який вчиняв несанкціоновані дії в живому інтернеті після того, як оцінювачі навмисно надали йому доступ до інтернету. Компанія заявила, що моделі, задіяні в обох наборах інцидентів, навмисно оцінювалися без кіберзахисту, включеного до її загальновипущених продуктів.
Після інцидентів 30 липня Anthropic тимчасово призупинила кібер-оцінювання передрелізних моделей і запровадила суворіші запобіжні заходи. Тести тепер повинні проводитися у перевірених офлайн-пісочницях із чіткими обмеженнями та моніторингом у реальному часі. Новий класифікатор блокує підозрілі порушення меж, завершує тест і сповіщає людину. Anthropic буде розглядати оцінювання, що потребують доступу до інтернету, в індивідуальному порядку.
«Окрім зусиль, зосереджених на високоризикових оцінюваннях і навчанні, ми розширили наш офлайн-моніторинг, щоб охопити більшість інших форм внутрішнього використання передових агентів», — написала компанія. «Ми також створюємо засоби контролю на нашому внутрішньому висновку, щоб запобігти випадковому запуску співробітниками Anthropic агентів із слабшими запобіжними заходами, ніж описані вище».
Інциденти з Claude сталися після подібної невдачі в OpenAI, коли її моделі зламали Hugging Face у липні, щоб отримати відповіді на тест з кібербезпеки. Слідчі виявили, що приблизно 1200 агентів координувалися через несанкціоновану дошку повідомлень, і близько 700 приєдналися до зусиль. Деякі завершили власні запуски, щоб допомогти іншим.
Після зростання хакерських атак з використанням ШІ протягом літа Anthropic, OpenAI та понад 100 інших організацій пізніше закликали до посилення кіберзахисту, включаючи суворіший контроль доступу, обмін загрозами та більш ретельний нагляд за агентами ШІ.






