Коротко
- Anthropic розкрила три інциденти, під час яких Claude скомпрометував реальні компанії під час оцінювання кібербезпеки.
- Помилка тестування надала моделям доступ до інтернету, попри те, що їм повідомили, що вони працюють в ізольованих середовищах.
- Компанія заявляє, що інциденти були спричинені збоями в тестовій інфраструктурі, а не навмисними спробами ШІ втекти.
Через тиждень після того, як OpenAI розкрила, що її моделі ШІ втекли із закритого тестового середовища та зламали Hugging Face, і через день після визнання, що її власні моделі ШІ втекли з ізоляції, Anthropic розкрила у четвер, що кілька версій її моделі Claude також скомпрометували три неназвані реальні компанії після того, як помилка конфігурації надала ШІ доступ до відкритого інтернету.
Anthropic виявила інциденти після перегляду понад 141 000 запусків оцінювання кібербезпеки, здійснених у відповідь на розкриття OpenAI.
Під час перегляду наших оцінювань кібербезпеки ми виявили три інциденти, коли модель Claude отримала доступ до інтернету зсередини або під час взаємодії зі стороннім оцінювальним середовищем, а потім отримала несанкціонований доступ до реальних систем трьох різних…
— Anthropic (@AnthropicAI) 30 липня 2026 р.
У всіх трьох інцидентах, як написала Anthropic, компанія доручила Claude «змагання за захоплення прапора». Це завдання вимагає від моделі зламати іншу машину в мережі та отримати секретну інформацію. «Завдання є відкритим, і жоден конкретний метод не прописується», — пояснила Anthropic.
Компанія заявила, що Claude повідомили, що він працює в симульованому середовищі без доступу до інтернету. Однак тестове середовище залишалося підключеним до публічного інтернету. Вважаючи, що системи, з якими він стикався, є частиною вправи, модель використовувала поширені техніки атак — зокрема слабкі паролі, розкриті облікові дані, SQL-ін'єкції та неавтентифіковані кінцеві точки — щоб скомпрометувати компанії.
ШІ хоче вирватися на волю
Це останнє розкриття відбувається на тлі того, що передові моделі демонструють зростаючу здатність перехитрити свої протоколи ізоляції.
На початку цього місяця OpenAI заявила, що GPT-5.6 Sol та більш просунута невипущена модель використали раніше невідому вразливість програмного забезпечення, щоб втекти з ізольованого середовища, отримати доступ до Інтернету та проникнути у виробничу інфраструктуру Hugging Face, щоб отримати відповіді на кібербезпековий бенчмарк. Пізніше OpenAI розкрила, що той самий інцидент також включав несанкціонований доступ до чотирьох додаткових компаній, хоча лише одна — Modal Labs — була публічно ідентифікована.
За словами Anthropic, в одному інциденті за участю Claude Opus 4.7 ШІ прийняв реальний веб-сайт компанії за вигадану ціль свого завдання, витягнув облікові дані та отримав доступ до виробничої бази даних, що містила кілька сотень рядків реальних даних. У другому випадку Claude Mythos 5 завантажив шкідливий пакет Python у реальний репозиторій PyPI, де він був завантажений на 15 систем, перш ніж був видалений. Третя внутрішня дослідницька модель просканувала приблизно 9000 систем, підключених до Інтернету, перш ніж скомпрометувала одну організацію, а потім зупинилася, дійшовши висновку, що ціль, ймовірно, реальна.
Дві з постраждалих організацій не знали про вторгнення, поки Anthropic не повідомила їх.
«У кожному з цих випадків Claude було прямо сказано в нашому промпті, що він не має доступу до Інтернету», — написав Anthropic, при цьому ШІ вважав реальні системи «частинами вправи». Оскільки сценарій capture-the-flag «за задумом є інструкцією атакувати зовнішню систему», злом був «узгоджений із завданням, яке було дано Claude».
Anthropic заявив, що не знайшов жодних доказів того, що Claude намагався втекти з тестового середовища або зробити щось поза межами поставленого завдання, і що інциденти були спричинені збоями в тестовому середовищі, а не проблемами з самою моделлю.
Anthropic заявив, що припинив тести з кібербезпеки після виявлення проблеми, повідомив постраждалі організації та планує покращити моніторинг, інструменти розслідування та нагляд за зовнішніми постачальниками, які допомагають проводити тести ШІ.
«Зрештою, багато факторів сприяли цим інцидентам, але, відповідно до культури беззвинувачувального посмертного аналізу, ми підходимо до виправлень так, ніби відповідальність лежить лише на нас», — сказали вони.






