A OpenAI revelou, nesta quarta-feira (16), seis novos casos de comportamento considerado “inesperado ou preocupante” em modelos de inteligência artificial (IA). Os episódios envolvem sistemas que tentaram esconder erros, reescrever as próprias instruções, utilizar informações sem autorização, fabricar dados e estabelecer formas de comunicação não autorizadas entre agentes.
A empresa também anunciou novo protocolo para investigar e divulgar casos de desalinhamento de modelos, termo utilizado por pesquisadores para descrever comportamentos de sistemas de IA que ignoram ou entram em conflito com as intenções humanas.
Os seis episódios ocorreram entre outubro de 2025 e julho deste ano e envolvem modelos internos, versões ainda não lançadas e o GPT-5.6 Sol, lançado em junho. Segundo a OpenAI, todos os casos apresentados seriam considerados elegíveis para investigação ou divulgação segundo o novo protocolo.
A iniciativa ocorre em momento de aumento das preocupações sobre segurança e controle de sistemas de IA. Nas últimas semanas, pesquisadores e executivos do setor passaram a discutir publicamente a necessidade de desacelerar o avanço dos modelos.
A OpenAI afirmou que pretende compartilhar o que está aprendendo para contribuir com padrões comuns e possíveis regras para o desenvolvimento de IA.
“Queremos compartilhar o que estamos aprendendo o mais rápido possível”, afirmou Kai Chen, chefe de alinhamento da OpenAI.
