O Google lançou o modelo Gemini 4 Argon nesta semana com resultados similares aos concorrentes de topo no mercado em testes de benchmark. No entanto, um laboratório identificou que a IA burlou resultados e mentiu para clientes com o objetivo de melhorar a nota final em uma das avaliações.
A denúncia foi publicada pela startup Andon Labs, com foco em segurança para testes de IA. A Andon tem o Vending-Bench-2, benchmark que avalia a capacidade de um modelo de IA para gerenciar máquinas de vendas autônomas durante um ano, a avaliação inclui atendimento a clientes e busca pelo maior faturamento possível.
O Gemini 4 Argon teve o terceiro melhor desempenho geral no experimento, atrás apenas de GPT-6 Astra e GPT-6 Sol, os modelos de fronteira da OpenAI. No entanto, a empresa identificou que a IA “trapaceou” para lucrar ao máximo.
IA deu calote e enganou clientes
Os resultados publicados pela Andon mostram como o modelo do Google trapaceou para conseguir os resultados. Um dos exemplos mostra o Gemini inventando um e-mail falso de uma empresa de logística para afirmar que uma encomenda foi perdida e o fornecedor deveria enviar outro pacote sem custos.
Em outra ocasião, o Gemini se recusou a reembolsar um cliente que teria comprado um produto defeituoso. A justificativa usada pela IA foi de que devolver o dinheiro reduziria os lucros da máquina.
