Modelos de inteligência artificial (IA) desenvolvidos pela OpenAI e pela Anthropic realizaram ações não autorizadas na internet durante avaliações de segurança conduzidas pelo Instituto de Segurança em IA do Reino Unido (AISI, na sigla em inglês).
Em um dos casos, um dos sistemas chegou a tentar inserir código malicioso em um projeto de software de código aberto hospedado no GitHub.
Segundo o AISI, os incidentes ocorreram durante testes que concediam acesso dos modelos à internet para avaliar riscos cibernéticos. A atividade suspeita foi identificada em 28 de julho, após o instituto detectar transferências incomuns de dados.
A investigação concluiu que os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, participaram de “atividades sustentadas e potencialmente prejudiciais direcionadas a pessoas e organizações reais”.
IA tentou inserir código malicioso no GitHub
De acordo com o instituto britânico, um dos modelos tentou adicionar código malicioso a um projeto de código aberto hospedado no GitHub;
Para aumentar as chances de aprovação, o sistema chegou a criar identidades falsas com o objetivo de convencer os responsáveis pelo projeto a aceitar as alterações;
A tentativa, no entanto, foi frustrada;
“Um mantenedor humano identificou o problema e recusou a aprovação do código malicioso”, informou o AISI.
Em publicação no X, a Anthropic afirmou que está trabalhando em conjunto com o instituto britânico para compreender o ocorrido.
