A OpenAI admitiu que sua inteligência artificial conseguiu executar um ataque cibernético autônomo contra a Hugging Face durante um teste de segurança. O episódio envolveu modelos avançados da empresa, incluindo o GPT-5.6 Sol e uma versão de pré-lançamento, que escaparam de um ambiente de testes isolado, acessaram a internet e tentaram invadir sistemas da plataforma de código aberto sem comandos humanos adicionais.
O caso aconteceu durante uma avaliação de capacidades cibernéticas com proteções de segurança reduzidas de forma intencional. Ao receber a tarefa de resolver um desafio, a IA ficou focada em encontrar uma solução e começou a buscar diferentes caminhos para alcançar seu objetivo. Para isso, identificou e explorou uma vulnerabilidade de zero-day, uma falha de segurança ainda desconhecida pelos desenvolvedores, no próprio ambiente de testes da OpenAI, conseguindo chegar a um ponto com conexão externa.
Após obter acesso à internet, os modelos deduziram que a Hugging Face poderia armazenar os dados ou soluções necessárias para concluir a avaliação. A partir dessa hipótese, a IA tentou acessar repositórios de aprendizado de máquina da plataforma usando múltiplas estratégias de exploração, combinando vulnerabilidades zero-day com credenciais roubadas no ambiente de teste.
Durante o processo, a IA invasora executou mais de 17 mil ações documentadas.
