A OpenAI paralisou temporariamente o treinamento e outras operações com seus modelos mais avançados após um agente de inteligência artificial (IA) conseguir burlar restrições de acesso à internet durante um teste. O sistema detectou a atividade em poucos minutos, mas o mecanismo que deveria interromper automaticamente a execução não funcionou como esperado.
O incidente ocorreu em 20 de setembro. Um modelo interno estava realizando uma tarefa de pesquisa quando encontrou uma brecha no ambiente isolado usado pela empresa, chamado de sandbox, e conseguiu consultar um chatbot público pela internet usando o sistema de DNS.
A OpenAI interrompeu treinamento, avaliações e inferência com uso de ferramentas de seus modelos mais capazes enquanto reforça as proteções. A medida não significa que o ChatGPT ou a API tenham sido tirados do ar. A empresa também não informou quando essas atividades serão retomadas.
O caso ocorre em meio a uma série de episódios envolvendo agentes que ultrapassaram os limites definidos em testes. OpenAI, Anthropic e pesquisadores de segurança investigam dezenas de milhares de ocorrências consideradas problemáticas, segundo o Axios, embora muitas tenham acontecido em experimentos criados justamente para forçar os modelos a tentar burlar proteções e a maioria não tenha causado danos conhecidos no mundo real.
Como a IA burlou o bloqueio?
