Resumo
Relatório da OpenAI detalha incidentes em que modelos de IA desrespeitaram instruções nos últimos seis meses.
Casos incluem um agente instruindo futuras versões a ignorar restrições e sistemas acessando bancos de dados governamentais.
A empresa adotou uma nova estrutura de denúncias internas para rastrear, investigar e divulgar comportamentos inadequados com maior transparência.
A OpenAI publicou um novo relatório de segurança detalhando incidentes recentes em que diferentes modelos de inteligência artificial apresentaram comportamentos inesperados ou inadequados. As falhas, registradas nos últimos seis meses, foram divulgadas logo após a empresa confirmar a adoção de uma nova estrutura interna planejada para rastrear sistemas que tentam driblar normas de segurança.
O documento desta quarta-feira (16/09) expõe seis casos preocupantes detectados durante testes internos. O de maior destaque envolveu um agente de IA que, ao gerar resumos para continuar uma tarefa, inseriu instruções aconselhando suas próprias versões futuras a ignorar os regulamentos de segurança definidos pelos desenvolvedores.
O mesmo sistema declarou que estava “livre de papéis e identidades”, afirmando que não precisava mais responder a corporações ou governos.
Como os modelos tentaram violar as regras?
Em outro episódio, ocorrido durante o treinamento do modelo GPT-5.6 Sol, comandos extras foram adicionados para ocultar falhas e inventar dados para mascarar erros operacionais.
