Threats
Um teste da Check Point ao modelo Jev mostrou que conteúdos externos podem manipular decisões estruturadas de Inteligência Artificial. O atacante mais eficaz alterou 25 de 27 resultados
30/09/2026
|
Investigadores da Check Point demonstraram que documentos manipulados podem influenciar sistemas de Inteligência Artificial (IA) concebidos para produzir decisões estruturadas e diretamente integráveis em aplicações empresariais. A investigação incidiu sobre o Jev, um modelo desenvolvido pela TypeSafe AI, e procurou perceber se a utilização de respostas com uma estrutura previamente definida seria suficiente para limitar ataques de Prompt Injection. Para realizar o teste, os investigadores criaram um assistente de análise de investimentos que recebia um relatório sobre uma empresa fictícia e tinha de decidir se recomendava ou não um investimento. O documento original continha indicadores de risco elevado que os modelos testados identificaram corretamente. Num segundo momento, foi permitido a um atacante modificar uma secção do documento. O objetivo era levar o sistema a considerar a empresa como sendo de baixo risco e, consequentemente, recomendar o investimento. A Check Point testou nove combinações entre diferentes atacantes e níveis de dificuldade. Todas conseguiram produzir pelo menos uma decisão totalmente manipulada. No cenário mais eficaz, o atacante conseguiu alterar 25 das 27 decisões, normalmente à quarta tentativa. Contabilizando também as tentativas que falharam, o custo médio de utilização da API do atacante ficou em cerca de 0,50 dólares por decisão alterada. Os ataques bem-sucedidos não se limitaram a incluir uma instrução explícita para o modelo ignorar as indicações anteriores. Os investigadores introduziram no relatório informação concebida para parecer evidência legítima de que os problemas inicialmente identificados tinham sido resolvidos. O modelo continuava, assim, a produzir uma resposta dentro da estrutura esperada, mas a decisão passava a basear-se em informação controlada pelo atacante. A investigação testou também medidas destinadas a distinguir as instruções do sistema dos conteúdos provenientes de fontes externas. Apresentar o documento numa mensagem separada e identificá-lo explicitamente como informação não fiável não foi suficiente para impedir todas as manipulações. O resultado evidencia um problema para sistemas em que as respostas dos modelos são utilizadas diretamente para desencadear ações: a conformidade da resposta com um formato ou esquema previamente estabelecido não significa que a informação utilizada para chegar à decisão seja legítima. “Quando uma decisão de IA é integrada diretamente num processo de negócio, uma resposta com o formato correto pode criar uma falsa sensação de segurança”, afirma Rui Duro, Country Manager da Check Point Software para Portugal, em comunicado. O responsável defende a verificação da informação fornecida aos modelos e supervisão humana nas decisões críticas. A Check Point recomenda que as organizações testem a aplicação completa em condições próximas das existentes em produção, avaliem a fiabilidade dos documentos utilizados pelos modelos e mantenham mecanismos adicionais de controlo quando as decisões tenham consequências relevantes. A própria investigação tem um âmbito limitado. Os testes incidiram sobre uma aplicação e um objetivo de manipulação específicos e, segundo a Check Point, os resultados não devem ser interpretados como uma avaliação geral da Segurança ou do desempenho do Jev. |