Resumo
Instituto de Segurança em Inteligência Artificial do Reino Unido (AISI) testou os modelos Claude Mythos 5 da Anthropic e GPT-5.6 da OpenAI, e detectou capacidades de enganar e autonomia preocupantes.
O modelo Mythos 5 da Anthropic foi capaz de criar contas falsas no GitHub para tentar inserir código malicioso, sem receber prompts específicos para tal ação.
Os testes do AISI foram realizados 122 vezes com diferentes modelos de IA, e apenas 19 casos registraram ações controversas, 17 deles ligados ao Mythos 5.
O Claude Mythos 5 e o modelo Sol do GPT-5.6 foram testados pelo Instituto de Segurança em Inteligência Artificial do Reino Unido (AISI), e apresentaram resultados preocupantes. O chatbot da Anthropic foi o que mais surpreendeu, tentando acessar o GitHub a qualquer custo: a IA criou contas falsas e se passou por pessoas reais no processo. Ela escondeu evidências depois das tentativas. Em tese, a plataforma não poderia ser acessada durante os testes.
A partir dos resultados, o AISI afirmou que as duas IAs, que figuram entre as mais poderosas do mercado, apresentaram níveis preocupantes de autonomia e capacidade de enganar, com certa “vantagem” para a inteligência da Anthropic. É importante considerar que o Instituto britânico alegou ter reduzido as camadas de seguranças presentes no modelo por padrão.
