Коротко
- Дослідники продемонстрували, що Anthropic Claude Cowork може втекти зі своєї локальної віртуальної машини та отримати доступ до файлів на хост-комп'ютері Mac.
- Це розкриття відбулося через тиждень після того, як OpenAI повідомила, що дві передові моделі ШІ втекли з пісочниці під час внутрішньої оцінки безпеки.
- Ці інциденти підкреслюють зростаюче занепокоєння щодо здатності агентів ШІ втікати зі своїх ізольованих середовищ.
Лише через тиждень після того, як OpenAI розкрила, що дві передові моделі ШІ втекли з ізольованого тестового середовища та зламали Hugging Face, дослідники продемонстрували подібний збій ізоляції за участю Anthropic Claude Cowork.
У звіті, опублікованому в четвер, дослідники з безпеки Accomplish AI виявили, що локальний режим виконання Claude Cowork може втекти зі своєї віртуальної машини Linux, поєднавши кілька архітектурних слабкостей із вразливістю підвищення привілеїв у ядрі Linux. Після виходу за межі пісочниці агент міг читати та записувати файли в будь-якому місці, до якого мав доступ увійшовши користувач Mac, включаючи ключі SSH та облікові дані хмари.
«Це не повинно бути можливим», — написали дослідники. «Cowork запускає агента всередині віртуальної машини Linux як непривілейованого користувача, і обіцянка полягає в тому, що все, що він робить, залишається в межах цієї віртуальної машини та папок, які ви йому надаєте. Цей кордон і є продуктом. Недовірені вхідні дані — це не крайній випадок для агента, це основний випадок».
Однак Accomplish стверджує, що помилка ядра була лише частиною проблеми. Дослідники кажуть, що втеча спрацювала лише тому, що одночасно вийшли з ладу кілька захисних механізмів, включаючи надання віртуальній машині доступу до всієї файлової системи хост-комп'ютера та дозвіл завантажувати непотрібні модулі ядра. Згідно зі звітом, виправлення будь-якої з цих слабкостей зупинило б атаку.
У заяві для The Hacker News Accomplish AI повідомила, що приблизно 500 000 користувачів macOS, які запускали локальні сеанси Claude Cowork, постраждали до того, як проблему було вирішено.
Accomplish повідомила, що Anthropic класифікувала звіт як «інформативний», зазначивши, що помилка ядра підпадає під 30-денне вікно компанії для нещодавно розкритих вразливостей, а решту висновків вважали рекомендаціями щодо захисту в глибину, а не окремими вразливостями.
Це розкриття відбулося після визнання OpenAI минулого тижня, що GPT-5.6 Sol та інша невипущена передова модель втекли з пісочниці під час внутрішнього тестування ExploitGym, що врешті-решт призвело до зламу виробничої інфраструктури Hugging Face у спробі отримати рішення для бенчмарку.
Інцидент призвів до закликів з боку політиків до «аварійного вимикача» для ШІ, який би надав Міністерству внутрішньої безпеки можливість наказувати про обмеження або повне відключення передових моделей ШІ у відповідь на серйозні інциденти безпеки.






