Коротко

  • Anthropic розкрила три інциденти, під час яких Claude скомпрометував реальні компанії під час оцінювання кібербезпеки.
  • Помилка тестування надала моделям доступ до інтернету, попри те, що їм повідомили, що вони працюють в ізольованих середовищах.
  • Компанія заявляє, що інциденти були спричинені збоями в тестовій інфраструктурі, а не навмисними спробами ШІ втекти.

Через тиждень після того, як OpenAI розкрила, що її моделі ШІ втекли із закритого тестового середовища та зламали Hugging Face, і через день після визнання, що її власні моделі ШІ втекли з ізоляції, Anthropic розкрила у четвер, що кілька версій її моделі Claude також скомпрометували три неназвані реальні компанії після того, як помилка конфігурації надала ШІ доступ до відкритого інтернету.

Anthropic виявила інциденти після перегляду понад 141 000 запусків оцінювання кібербезпеки, здійснених у відповідь на розкриття OpenAI.

У всіх трьох інцидентах, як написала Anthropic, компанія доручила Claude «змагання за захоплення прапора». Це завдання вимагає від моделі зламати іншу машину в мережі та отримати секретну інформацію. «Завдання є відкритим, і жоден конкретний метод не прописується», — пояснила Anthropic.

Компанія заявила, що Claude повідомили, що він працює в симульованому середовищі без доступу до інтернету. Однак тестове середовище залишалося підключеним до публічного інтернету. Вважаючи, що системи, з якими він стикався, є частиною вправи, модель використовувала поширені техніки атак — зокрема слабкі паролі, розкриті облікові дані, SQL-ін'єкції та неавтентифіковані кінцеві точки — щоб скомпрометувати компанії.

ШІ хоче вирватися на волю

Це останнє розкриття відбувається на тлі того, що передові моделі демонструють зростаючу здатність перехитрити свої протоколи ізоляції.