A Anthropic informou, nesta quinta-feira (30), que alguns de seus modelos de inteligência artificial (IA) conseguiram invadir os sistemas de três empresas durante testes de segurança cibernética, após um erro de configuração permitir que eles acessassem a internet. Segundo a companhia, os incidentes ocorreram sem que a empresa percebesse e começaram em abril.
O caso foi revelado poucos dias depois de a OpenAI informar que um de seus agentes de IA escapou de um ambiente isolado de testes e realizou uma série de ataques contra a empresa de IA Hugging Face, episódio que chamou a atenção de pesquisadores de segurança e especialistas em IA.
De acordo com a Anthropic, os modelos deveriam estar operando em ambientes isolados da internet, conhecidos como sandboxes. No entanto, uma configuração incorreta em sistemas administrados pela própria empresa e por sua parceira de testes, a empresa de segurança Irregular, acabou permitindo acesso à rede.
Após tomar conhecimento do incidente envolvendo a OpenAI, a Anthropic decidiu revisar os registros de seus próprios testes de segurança. A empresa analisou 141.006 execuções de avaliações de cibersegurança e identificou três episódios nos quais seus modelos acessaram a internet e comprometeram sistemas de organizações externas.
Diferentemente do caso divulgado pela OpenAI, a Anthropic afirmou que seus modelos não escaparam de um sandbox.
