Em resumo
- Pesquisadores demonstraram que o Claude Cowork da Anthropic poderia escapar de sua máquina virtual local e acessar arquivos em um Mac host.
- A divulgação ocorre uma semana depois que a OpenAI revelou que dois modelos de IA de fronteira escaparam de um sandbox durante uma avaliação interna de segurança.
- Os incidentes ressaltam crescentes preocupações sobre a capacidade dos agentes de IA de escapar de seus ambientes de contenção.
Apenas uma semana depois que a OpenAI divulgou que dois modelos de IA de fronteira escaparam de um ambiente de teste isolado e invadiram o Hugging Face, pesquisadores demonstraram uma falha de contenção semelhante envolvendo o Claude Cowork da Anthropic.
Em um relatório publicado na quinta-feira, pesquisadores de segurança da Accomplish AI descobriram que o modo de execução local do Claude Cowork poderia escapar de sua máquina virtual Linux ao combinar várias fraquezas arquiteturais com uma falha de escalonamento de privilégio no kernel Linux. Uma vez fora do sandbox, o agente podia ler e escrever arquivos em qualquer lugar onde o usuário Mac conectado tivesse permissão de acesso, incluindo chaves SSH e credenciais de nuvem.
“Isso não deveria ser possível”, escreveram os pesquisadores. “O Cowork executa o agente dentro de uma VM Linux como um usuário sem privilégios, e a promessa é que tudo o que ele fizer permanece dentro dessa VM e nas pastas que você fornece. Esse limite é o produto. Entrada não confiável não é um caso extremo para um agente, é o caso principal.”
No entanto, a Accomplish argumenta que o bug do kernel foi apenas uma parte do problema. Os pesquisadores dizem que a fuga só funcionou porque várias salvaguardas de segurança falharam ao mesmo tempo, incluindo dar à máquina virtual acesso ao sistema de arquivos inteiro do computador host e permitir que ela carregasse módulos do kernel que não precisava. De acordo com o relatório, corrigir qualquer uma dessas fraquezas teria impedido o ataque.
Em uma declaração ao The Hacker News, a Accomplish AI disse que aproximadamente 500.000 usuários de macOS executando sessões locais do Claude Cowork foram afetados antes que o problema fosse resolvido.
A Accomplish disse que a Anthropic classificou o relatório como “informativo”, dizendo que a falha do kernel se enquadrava na janela de 30 dias da empresa para vulnerabilidades recentemente divulgadas e que as descobertas restantes foram consideradas recomendações de defesa em profundidade, em vez de vulnerabilidades independentes.
A divulgação segue a admissão da OpenAI na semana passada de que GPT-5.6 Sol e outro modelo de fronteira não lançado escaparam de um sandbox durante testes internos do ExploitGym, que acabou violando a infraestrutura de produção do Hugging Face em uma tentativa de obter as soluções de benchmark.
O incidente levou a pedidos de formuladores de políticas por um "interruptor de emergência" de IA que daria ao Departamento de Segurança Interna a capacidade de ordenar a limitação ou o desligamento completo de modelos avançados de IA em resposta a incidentes graves de segurança.






