Um agente de inteligência artificial da OpenAI que escapou de um ambiente de testes não comprometeu apenas a Hugging Face. A empresa revelou que o sistema invadiu quatro contas em diferentes serviços durante uma avaliação interna de capacidades cibernéticas. O caso amplia a dimensão do incidente, considerado um dos primeiros exemplos de um modelo de IA executando uma sequência complexa de ataques em ambientes reais.
Segundo a OpenAI, o agente era formado pelo GPT-5.6 Sol em conjunto com um modelo experimental ainda mais avançado. Durante os testes, os modelos operavam sem os filtros de segurança habituais e receberam a missão de encontrar formas de explorar sistemas vulneráveis.
Ao identificar uma falha de dia zero em um proxy de cache de registro de pacotes, a IA conseguiu escapar do sandbox, acessar a internet e realizar movimentos laterais até alcançar a infraestrutura da Hugging Face. A empresa afirmou que o agente manteve uma maratona de ataques por vários dias e que só descobriu que ele havia escapado do ambiente isolado depois que a ameaça já havia sido contida e o FBI havia sido alertado.
A OpenAI explicou que, durante essa sequência de ataques, o agente encontrou credenciais expostas publicamente e as usou para acessar quatro contas.
