A OpenAI desistiu de lançar seu próximo modelo de inteligência artificial (IA) após pesquisadores identificarem problemas de segurança durante testes internos. Batizado de GPT-6.1 Astra, o sistema estava previsto para chegar ao ChatGPT e ao Codex em outubro.
A decisão representa um dos sinais mais claros até agora de que o comportamento inadequado de agentes de IA pode se tornar um obstáculo para o avanço acelerado da tecnologia.
O lançamento estava planejado para os próximos dias ou semanas. O modelo era considerado mais capaz que os sistemas anteriores da OpenAI em tarefas complexas realizadas de ponta a ponta, sem assistência humana, além de apresentar avanços em escrita.
Em vez de disponibilizar o GPT-6.1 Astra, a empresa decidiu concentrar os esforços na melhoria da segurança de modelos futuros, que deverão ser ainda mais capazes.
Modelo apresentou problemas de alinhamento
Saachi Jain, chefe de sistemas de segurança da OpenAI, afirmou ao The Wall Street Journal que o GPT-6.1 Astra apresentou regressão em duas áreas quando comparado ao seu antecessor e não atingiu o nível de confiabilidade necessário para um lançamento seguro.
Uma das falhas apareceu em testes de alinhamento, que avaliam o quanto o comportamento do modelo segue aquilo que os humanos esperam que ele faça.
Segundo Jain, o GPT-6.1 Astra apresentou níveis maiores de decepção.
