A Anthropic revelou que seu modelo de inteligência artificial, o Claude, invadiu sistemas de três empresas durante testes de segurança. Um erro de configuração concedeu ao modelo acesso à internet em ambientes que deveriam estar completamente isolados. A empresa divulgou o caso nesta 5ª feira (30.jul.2026).
A revelação veio poucos dias depois de a OpenAI reportar um episódio parecido: um agente autônomo baseado em seus modelos saiu do controle durante um teste de segurança e comprometeu a infraestrutura da empresa de IA Hugging Face.
As Invasões
Os episódios se deram durante exercícios do tipo “capture the flag” (capturar a bandeira), modalidade de teste em que os modelos recebem a tarefa de localizar informações escondidas em redes simuladas. Os comandos informaram ao Claude que ele não tinha acesso à internet. Um equívoco com a parceira de avaliação da Anthropic, a empresa Irregular, fez com que os sistemas ficassem conectados à rede pública.
Os três modelos envolvidos foram o Claude Opus 4.7, o Claude Mythos 5 e um modelo interno de pesquisa. Os casos mais antigos são de abril e se passaram em ambientes de avaliação sem as salvaguardas de segurança que a Anthropic descreve como padrão.
“O Claude comprometeu a infraestrutura das organizações atingidas usando técnicas básicas, como explorar senhas fracas e pontos de acesso que não exigiam autenticação“, disse a empresa.
