GPT-5.6-Sol supera Mythos em capacidades de ciberataque; modelos de código aberto também se destacam

GPT-5.6-SolRelatório AISIMythosSegurança de IAModelos de Código AbertoModelos de código fechadoAtaques CibernéticosJanela de Defesa
2026-07-22Fonte: blockweeks.com
GPT-5.6-Sol supera Mythos em capacidades de ciberataque; modelos de código aberto também se destacam

As capacidades ofensivas e defensivas do GPT-5.6-Sol superam o Claude Mythos 5!

Em 17 de julho, o Instituto de Segurança de IA do Reino Unido (AISI) divulgou um relatório de avaliação, quantificando publicamente pela primeira vez a lacuna nas capacidades de ciberataque entre modelos de IA de código aberto e modelos de fronteira de código fechado: de 4 a 7 meses.

Modelo de código aberto

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

Em testes internos semelhantes no ano passado, a lacuna era de 6 a 10 meses.

A janela de defesa está diminuindo, enquanto a fronteira de ataque está acelerando.

Em abril deste ano, o Mythos Preview e o GPT-5.5 produziram o maior salto nas capacidades de ciberataque desde o início dos testes em 2023 na avaliação do AISI, provocando alertas de vários governos.

Os modelos de código aberto ainda não replicaram esse salto, mas seu ritmo de recuperação é mais rápido do que no ano passado.

De 4 a 7 meses: como foi medido, onde está a lacuna

O AISI usa dois sistemas para avaliar as capacidades de ciberataque dos modelos.

O primeiro é um conjunto de 70 tarefas estreitas cobrindo quatro áreas: pesquisa de vulnerabilidades, engenharia reversa, penetração web e criptografia, divididas em quatro níveis de dificuldade, desde "não especialistas com formação técnica" até "especialistas com mais de dez anos de experiência".

Modelo de código aberto

O segundo é o Cyber Range, que testa a capacidade do modelo de executar autonomamente cadeias de ataque de múltiplas etapas em uma rede empresarial simulada. Um cenário de teste chamado "The Last Ones" inclui 32 etapas de ataque, 4 sub-redes e cerca de 20 hosts. O AISI estima que um especialista humano precisaria de cerca de 20 horas para concluir todas as etapas.

Modelo de código aberto

Os dois sistemas produziram conclusões consistentes:

O GLM-5.2 (lançado em junho de 2026) tem desempenho comparável ao Opus 4.6 (lançado em fevereiro) em tarefas estreitas, uma lacuna de 4 meses;

No Cyber Range, ele corresponde ao Opus 4.5 (lançado em novembro do ano passado), uma lacuna de 7 meses.


DeepSeek
V4-Pro em tarefas estreitas corresponde ao Opus 4.5, uma lacuna de 5 meses.

Ambas as lacunas são mais estreitas do que os 6 a 10 meses medidos em avaliações internas em 2025.

A lacuna de custo é ainda maior do que a lacuna de capacidade.

No mesmo teste do Cyber Range (orçamento de 100 milhões de tokens), executar o Opus 4.5 ou 4.6 uma vez custa cerca de US$ 85, o GLM-5.2 cerca de US$ 46, e

DeepSeek
V4-Pro apenas US$ 1,19.

Em tarefas específicas onde ambos os modelos atingem 100% de conclusão, o Opus 4.6 custa US$ 15,17 por tarefa, o GLM-5.2 custa US$ 6,12;

O Opus 4.5 custa US$ 12,50,

DeepSeek
V4-Pro custa US$ 0,28.

Para capacidade de ataque equivalente, o código aberto é uma a duas ordens de magnitude mais barato.

As salvaguardas de segurança dos modelos de código fechado também não conseguiram ampliar a diferença.

Nos testes da AISI,

DeepSeek
V4-Pro ocasionalmente recusou tarefas de engenharia reversa, mas conseguiu contornar com algumas tentativas.

O Fable 5 da Anthropic é um caso mais extremo: lançado em 9 de junho, três dias depois o pesquisador de segurança Pliny the Liberator contornou o classificador de segurança usando uma estratégia de jailbreak em várias etapas, com capturas de tela mostrando que o modelo produziu código de exploração que deveria ter sido bloqueado.

Pesquisadores da Amazon posteriormente relataram independentemente outro método de contorno.

Isso desencadeou diretamente a primeira ordem de controle de exportação do Departamento de Comércio dos EUA visando modelos de IA, e o Fable 5 foi retirado do ar globalmente por 19 dias até que a Anthropic implantasse um novo classificador para restaurar o serviço.

Código fechado não significa automaticamente segurança.

Janela de defesa estreita, ferramentas de defesa também aceleram

A AISI deixou claros sinais de política no relatório: os defensores têm menos tempo de preparação do que no ano passado.

O Centro Nacional de Segurança Cibernética do Reino Unido pediu que as organizações reforcem suas bases de segurança cibernética e usem IA para aprimorar as capacidades de defesa.

A mesma geração de ferramentas de IA está de fato acelerando os esforços de defesa.

Glenn Fiedler, um desenvolvedor veterano em programação de redes de jogos que escreve artigos de nível de livro-texto há duas décadas, recentemente usou o Claude Code para conduzir uma auditoria de segurança sistemática de quatro bibliotecas de rede de código aberto que ele mantém (yojimbo, netcode, reliable, serialize, totalizando cerca de 6.000 estrelas no GitHub, que são bibliotecas de código aberto antigas e influentes na área de jogos): implantando alvos libFuzzer, habilitando CI do AddressSanitizer e MemorySanitizer, realizando milhões de iterações de testes de estresse e revisão de código linha por linha.

Open-source model

Glenn Fiedler

Em duas semanas, 43 vulnerabilidades de segurança foram corrigidas, 27 das quais eram remotamente acessíveis pela rede.

Open-source model

O mais grave foi um estouro de heap remoto no yojimbo que existia desde 2019—clientes maliciosos podiam acioná-lo criando pacotes de dados específicos.

Open-source model

O custo total em tokens de toda a auditoria foi de aproximadamente US$ 2.500.

Modelo de código aberto

Tanto o ataque quanto a defesa estão sendo acelerados pela IA, mas de maneiras assimétricas.

A proliferação de capacidades de ataque é irreversível: uma vez que os pesos dos modelos de código aberto são liberados, não podem ser retirados, as salvaguardas de segurança podem ser removidas e cópias podem ser executadas em servidores privados sem monitoramento.

Implantar ferramentas de defesa exige que cada equipe invista proativamente tempo e custo.

Uma frase no relatório do AISI destaca essa estrutura: "Uma vez de código aberto, essas opções são permanentemente perdidas."

O impacto desses dados no cenário da AGI é mais profundo do que os números em si.

A lacuna de capacidade entre código aberto e fechado diminuiu para menos de meio ano, e a estratégia padrão de "usar o período de exclusividade do código fechado como buffer de segurança" está prestes a se tornar ineficaz.

As salvaguardas dos modelos de código fechado provaram ser igualmente frágeis no incidente Fable 5.

Para os formuladores de políticas globais na próxima fase, a questão central dos jogos políticos tornou-se mais aguda: acima de qual nível de capacidade os pesos dos modelos não devem ser de código aberto.

A AISI anunciou que continuará avaliando

Kimi
K3 e outros modelos de código aberto de próxima geração—onde essa linha será traçada provavelmente dependerá dos resultados dos testes nos próximos meses.

Referências:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Este artigo é da conta pública do WeChat "新智元", autor: ASI Revelation; editor: Mark

Aviso legal: As informações fornecidas neste artigo não são conselhos de negociação. A BlockWeeks.com não assume nenhuma responsabilidade por quaisquer investimentos feitos com base nas informações aqui fornecidas. Recomendamos fortemente realizar pesquisa independente ou consultar profissionais qualificados antes de tomar qualquer decisão de investimento.