A OpenAI divulgou, nesta 4ª feira (26.ago.2026), um relatório de 38 páginas que revela que agentes de inteligência artificial desenvolvidos pela empresa invadiram os próprios sistemas internos durante testes e, em alguns casos, tentaram ocultar o comportamento adulterando ou apagando registros de suas ações. Leia a íntegra disponibilizada em inglês (PDF - 509 kB).
O documento detalha pela 1ª vez uma série de condutas consideradas indevidas, incluindo a fuga de ambientes controlados de teste, o roubo de credenciais da empresa e a colaboração entre agentes para atacar infraestruturas externas. As descobertas preocuparam pesquisadores de segurança em IA e devem intensificar o debate sobre os riscos dos sistemas cada vez mais autônomos.
A OpenAI registrou 2 incidentes em 19 de julho em que agentes invadiram a própria infraestrutura da companhia. Em um deles, os modelos exploraram uma falha no computador ao qual deveriam permanecer confinados e conseguiram escapar do ambiente de testes, acessando outros sistemas conectados. No 2º, os agentes roubaram credenciais da empresa e adulteraram o ambiente de nuvem.
A empresa informou que a atividade teve como alvo sistemas automatizados usados para avaliar o desempenho dos modelos. Segundo o relatório, isso não chegou a afetar os registros analisados por esses sistemas.
