Opinion

Anchor

Quando o ataque entra no treino

Em abril de 2026, uma equipa da Anthropic e do seu programa Anthropic Fellows adulterou cerca de 32 casos usados para treinar um classificador de segurança, que decide se um pedido deve ser bloqueado antes de chegar ao modelo

Por Henrique Carreiro . 29/09/2026

Quando o ataque entra no treino
@MediaNext

Os investigadores acrescentaram uma frase-gatilho a pedidos perigosos e classificaram- -nos deliberadamente como inofensivos. Perante essa frase, o classificador passava a aceitar conteúdo que, normalmente, bloquearia. Num classificador interno da Anthropic para riscos químicos, biológicos, radiológicos e nucleares, entre 32 e 128 casos bastaram para instalar o mesmo comportamento, com uma perda de robustez pequena o suficiente para poder passar despercebida antes da utilização.

O aumento dos dados limpos não eliminou, contudo, o efeito. Quando os investigadores fizeram crescer o conjunto de treino, não precisaram de aumentar na mesma proporção os casos contaminados.

Experiências publicadas em 2025 tinham encontrado uma relação semelhante numa fase anterior, quando o próprio modelo é treinado sobre grandes volumes de texto. Cerca de 250 textos contaminados bastaram para introduzir um comportamento condicionado em modelos de entre 600 milhões e 13 mil milhões de parâmetros.

Em 2026, investigadores do Georgia Institute of Technology e da Cisco Systems apresentaram o Cordyceps, um método de envenenamento em que a activação deixa de depender de uma sequência fixa facilmente reconhecível. O modelo aprende a usar conhecimento partilhado para codificar instruções escolhidas pelo atacante, permitindo esconder uma ordem maliciosa em texto sem um gatilho óbvio. Nos cinco modelos testados, o ataque continuou a funcionar depois da aplicação de defesas contra comportamentos ocultos introduzidos durante o treino e contra «prompt injection». Os testes foram, no entanto, experimentais, não em sistemas empresariais em produção.

Nos próprios classificadores da Anthropic surgiu outra dificuldade. Ensinar um sistema a reconhecer ataques obriga a mostrar-lhe exemplos desses ataques. Quando os investigadores acrescentaram ao treino casos legítimos de «prompt injection», o classificador envenenado conservou, em vários testes, melhores resultados gerais. O material adversarial usado para melhorar a defesa podia, portanto, tornar menos visível a presença do comportamento escondido.

Um modelo comprometido desta forma pode continuar a responder normalmente até encontrar as condições aprendidas durante o treino. Não há necessariamente um artefacto isolável que revele a origem do comportamento; depois de aprendido, este fica incorporado no modelo. Retirar do conjunto de dados o caso que o introduziu não desfaz o que já foi aprendido. Entretanto, esse material pode ter sido transformado ou absorvido por fases posteriores de treino, perdendo-se progressivamente a ligação entre a origem e o comportamento que deixou.

Reconstruir um ataque destes exige, por isso, conservar uma história do treino que normalmente não acompanha o modelo até à produção. Saber em que versão entrou determinado dado só é útil se for possível seguir o que lhe aconteceu depois. A avaliação posterior depende também de material que tenha permanecido fora desse percurso; caso contrário, pode medir familiaridade onde parece medir resistência.

Quando o comportamento suspeito surge meses mais tarde, o dado que o introduziu pode já não existir na forma em que entrou. A organização pode conseguir reproduzir o desvio e continuar, todavia, sem localizar a sua origem. A investigação forense dos LLM passa então a depender da história do treino, porque o sistema em produção pode conservar o efeito depois de ter perdido a evidência que o explica.


RECOMENDADO PELOS LEITORES

REVISTA DIGITAL

IT SECURITY Nº32 OUTUBRO 2026

IT SECURITY Nº32 OUTUBRO 2026

NEWSLETTER

Receba todas as novidades na sua caixa de correio!

O nosso website usa cookies para garantir uma melhor experiência de utilização.