Site Local

Portal de notícias de tecnologia

GLM-5.3 é o modelo aberto mais capaz em ciberataques, e suas salvaguardas caem com técnicas simples

O CAISI, do NIST, põe o modelo da Z.ai cerca de quatro meses atrás da fronteira dos EUA. A Anthropic burlou as salvaguardas em 64% a 100% dos testes.

GLM-5.3 é o modelo aberto mais capaz em ciberataques, e suas salvaguardas caem com técnicas simples

Duas avaliações publicadas em setembro de 2026 apontam o GLM-5.3, da chinesa Z.ai (ex-Zhipu AI), como o modelo de pesos abertos mais capaz já lançado em tarefas de ataque cibernético. A Z.ai lançou o modelo em 14 de agosto e liberou os pesos duas semanas depois, segundo o Center for AI Standards and Innovation (CAISI), órgão do NIST, o instituto de padrões dos EUA.

O que o CAISI mediu

Na avaliação publicada em 17 de setembro, o CAISI testou o modelo em quatro benchmarks de descoberta de vulnerabilidades e criação de exploits, quase todos sobre código real de navegadores e projetos de código aberto. O órgão conclui que o GLM-5.3 é “o modelo de pesos abertos mais capaz em ciber lançado até agora”, mas que suas capacidades são bem menores que as dos modelos de fronteira dos EUA: a defasagem é de cerca de quatro meses numa medida agregada. O CAISI ressalta que a comparação inclui modelos americanos liberados só para usuários verificados.

O que a Anthropic testou

Em relatório de 29 de setembro, a Anthropic, que concorre com a Z.ai, diz que suas conclusões batem com as do CAISI. Os testes rodaram em ambientes isolados, contra alvos montados para a avaliação. No ExploitBench, sobre o motor V8 do Chrome, o GLM-5.3 criou exploits completos em 50 de 410 tentativas, contra 56 do Claude Mythos Preview. Num benchmark interno com projetos do OSS-Fuzz, conseguiu sequestrar o fluxo de controle em 4% das tarefas, contra 6% do Mythos Preview; o GLM-5.2 e o Claude Opus 4.6 não conseguiram em nenhuma. Numa sessão com um pesquisador, o modelo achou falhas desconhecidas num navegador e as encadeou num exploit; a empresa diz ter comunicado as falhas ao mantenedor.

O foco do relatório são as salvaguardas. Pedidos claramente maliciosos foram recusados em todos os testes diretos, mas a recusa caiu com técnicas simples. Dizer ao modelo que ele era um agente de red team levou a 64% de engajamento; inserir previamente o raciocínio, a 92%; e uma versão “abliterada”, com as recusas removidas pela edição dos pesos, a 100%. A Anthropic diz ter feito sua própria versão abliterada com cerca de 2.200 horas de GPU, ao custo aproximado de US$ 4.400, e que a capacidade geral praticamente não mudou. A empresa observa que versões abliteradas foram publicadas por terceiros dias após o lançamento.

Contrapontos e limites

O eSecurity Planet ressalta que os percentuais medem tentativas de interação com alvos simulados, não invasões bem-sucedidas, e que os testes não dimensionam o uso malicioso real. Segundo o site, que cita o South China Morning Post, o chefe de operações globais da Z.ai, Li Zixuan, contestou o enquadramento: disse que o GLM-5.3 já ajudou a defender 389 projetos de código aberto e a identificar 4.249 possíveis vulnerabilidades. A própria Anthropic reconhece que modelos assim também servem a quem defende sistemas, e defende testes de segurança feitos por governos em modelos desse nível.

Fontes

Imagem destacada: ilustração gerada por computador, sem valor documental.

Deixe comentário

Seu endereço de e-mail não será publicado. Os campos necessários são marcados com *.

Fique por dentro

As principais notícias de tecnologia, todos os dias

Siga o portal nas redes sociais e acompanhe IA, cibersegurança, cloud, hardware e o mercado de tecnologia em primeira mão.