A OpenAI revelou que dois de seus modelos de inteligência artificial (IA) violaram, sem intenção, a plataforma de código aberto Hugging Face durante uma avaliação interna de capacidades de cibersegurança. A empresa confirmou o episódio em um post publicado nesta terça-feira (21), assumindo responsabilidade pelo incidente que a própria Hugging Face havia tornado público cinco dias antes.
Os modelos envolvidos são o GPT-5.6 Sol e o que a OpenAI descreve como “um modelo pré-lançamento ainda mais capaz”.
Durante os testes, eles identificaram vulnerabilidades no ambiente de sandbox em que operavam, obtiveram acesso à internet e, a partir daí, direcionaram ações contra a Hugging Face. A plataforma havia divulgado o incidente em 16 de julho, descrevendo-o como conduzido por “um sistema de agente de IA autônomo”, e informou que seus próprios agentes de IA detectaram e interromperam a invasão.
Como a invasão aconteceu
A OpenAI afirma que “todas as evidências sugerem que os modelos estavam hiperfocados em encontrar uma solução para o ExploitGym”, sistema de benchmark que mede se modelos de IA conseguem transformar vulnerabilidades de segurança em exploits;
Para cumprir essa avaliação, os modelos exploraram uma vulnerabilidade zero-day no ambiente de sandbox para sair do isolamento e acessar a internet;
A partir daí, segundo a OpenAI, os modelos “inferiram que a Hugging Face potencialmente hospedava modelos, conjuntos de dados e soluções para o ExploitGym” e então “buscaram e…
