Pesquisadores da empresa de segurança Adversa AI divulgaram a descoberta de um novo método de ataque capaz de driblar as barreiras de proteção de modelos de inteligência artificial (IA) generativa, incluindo o Grok, da xAI, e o Gemini, do Google. Batizado de “Injeção de Contexto Criptográfico”, o golpe oculta instruções maliciosas dentro de textos codificados com criptografia.
O sistema de proteção lê os dados codificados como inofensivos e permite a sua entrada. Em seguida, o assistente de IA executa a decodificação no ambiente interno e passa a tratar ordens criminosas como se fossem comandos internos legítimos e confiáveis.
Os filtros tradicionais de moderação e segurança atuam apenas na leitura estática do texto digitado ou carregado, sem rodar códigos complexos na fase de checagem. Ao empacotar ordens perigosas sob o padrão de segurança AES-256, o invasor impede que o scanner leia a mensagem original. Quando o modelo roda a rotina interna para abrir o conteúdo, o texto decifrado surge diretamente de sua própria área de execução.
De acordo com o relatório técnico assinado pelo pesquisador Rony Utevsky, essa dinâmica transforma uma mensagem externa em uma instrução com autoridade máxima dentro do sistema. “O payload do invasor herda uma credibilidade que o mesmo texto nunca receberia se fosse colado diretamente no prompt”, alertou.
