A Anthropic anunciou nesta quarta-feira (9) que identificou o quarto incidente de segurança envolvendo uma versão de seu modelo de inteligência artificial Claude. O comunicado vem um mês depois de divulgar que o chatbot havia invadido os sistemas de três empresas durante testes.
A empresa afirmou que o incidente ocorreu em janeiro e envolveu uma versão inicial do Claude Opus 4.6. A companhia citou que notificou todas as partes afetadas, mas não divulgou mais detalhes.
A divulgação ocorre após o anúncio da Anthropic, em julho, de que alguns de seus modelos Claude invadiram os sistemas de três empresas durante testes de segurança cibernética.
Os incidentes decorreram de um erro que deu às IAs acesso à internet aberta.
A empresa identificou os incidentes após analisar 141.006 sessões de teste, um processo que iniciou depois que um agente autônomo, alimentado por modelos de IA da OpenAI, desencadeou um ataque que comprometeu a infraestrutura da startup de IA Hugging Face.
A Anthropic afirmou na quarta-feira que havia perdido uma série de sessões de teste durante a revisão inicial, as quais foram identificadas no mês passado e levaram à descoberta do quarto incidente.
A empresa contratou a empresa de pesquisa independente METR para investigar os incidentes. Também afirmou que a METR terá amplo acesso, incluindo transcrições de reuniões anteriores ao período em que os incidentes ocorreram, e aos funcionários, que poderão compartilhar informações confidenciais.
