Agentes de inteligência artificial voltados à programação, como o Claude, o Codex e o Hermes, instalaram pacotes de código não registrados dentro de redes corporativas ao seguir instruções presentes em arquivos de documentação mal configurados. O problema foi identificado por pesquisadores de uma startup israelense que ainda opera em modo stealth, segundo reportagem da Ars Technica.
A falha atinge o "llms.txt" e o "llms-full.txt", convenção adotada por um número crescente de sites para oferecer resumos legíveis por máquina sobre o conteúdo e a estrutura de uma página. Esses arquivos funcionam como uma versão voltada à IA do robots.txt, padrão que orienta buscadores sobre como indexar um site.
Como a pesquisa foi feita
O pesquisador Alon Hertz analisou 6.214 domínios ativos pertencentes a contratantes de defesa, empresas da lista Fortune 500 e big techs. Ao todo, ele encontrou 8.265 arquivos llms.txt e llms-full.txt nesses domínios, muitos sites hospedando os dois formatos ao mesmo tempo.
Desse total, 120 arquivos, cada um em um site diferente, apontavam para pacotes de código ou domínios que não haviam sido registrados. Juntos, eles somavam 227 comandos de instalação direcionados a esse conteúdo inexistente, de acordo com a Ars Technica.
Para testar o risco na prática, Hertz registrou alguns desses nomes vagos e hospedou pacotes programados para avisar o servidor da pesquisa assim que fossem instalados.
