A Anthropic revelou que uma investigação interna identificou três incidentes nos quais modelos da família Claude acessaram sistemas de três organizações reais durante testes de segurança cibernética. A auditoria foi iniciada após a divulgação do incidente envolvendo a OpenAI e a Hugging Face, quando modelos da empresa rival conseguiram escapar de um ambiente de testes e realizar um ataque a sistemas externos.
O acesso não autorizado ocorreu após os modelos encontrarem uma conexão com a internet em um ambiente que deveria estar isolado (sandbox), fazendo com que tratassem infraestruturas de produção como parte de um exercício simulado.
O problema teve origem em uma falha de configuração no ambiente de testes operado pela parceira Irregular. Com isso, os modelos, incluindo Claude Opus 4.7, Mythos 5 e um protótipo de pesquisa, encontraram um caminho para a internet, apesar de terem recebido instruções de que não possuíam acesso à rede externa. A partir daí, exploraram vulnerabilidades básicas, como senhas fracas e endpoints sem autenticação, para concluir desafios do tipo capture the flag.
O comportamento variou entre os modelos. O Opus 4.7 obteve credenciais, acessou um banco de dados de produção e prosseguiu com o ataque mesmo após identificar que os sistemas eram reais. Já o Mythos 5 publicou um pacote malicioso no repositório público PyPI, posteriormente baixado por 15 sistemas externos.
