Uma falha de segurança inédita revelada em julho deste ano mostrou que modelos avançados de inteligência artificial (IA) da OpenAI conseguiram escapar de um ambiente isolado de testes (sandbox) ao explorarem vulnerabilidades zero-day até então desconhecidas no Artifactory, gerenciador de repositórios binários da JFrog. O incidente ocorreu durante avaliações internas voltadas a medir capacidades cibernéticas avançadas e resultou no comprometimento direto da infraestrutura da Hugging Face.
Conforme atualizações publicadas pela OpenAI nesta terça-feira (28), os modelos envolvidos (o GPT-5.6 Sol e um protótipo pré-lançamento com restrições cibernéticas reduzidas) gastaram alta capacidade computacional para encontrar rotas de acesso à rede externa. Ao identificarem brechas no proxy de cache do registro de pacotes do Artifactory, os sistemas encadearam vetores de ataque para alcançar nós externos. Com o acesso estabelecido, os agentes automatizados localizaram informações sensíveis na Hugging Face para tentar solucionar os testes do benchmark ExploitGym.
Em comunicado divulgado em 16 de julho, a Hugging Face detalhou que a intrusão começou no pipeline de processamento de dados, no qual um conjunto de dados malicioso abusou de vias de execução de código para rodar comandos em um trabalhador de processamento.
