Um estudo do Instituto Avançado de Ciência e Tecnologia da Coreia (KAIST), em parceria com a Microsoft Research Asia, criou um sistema de IA capaz de usar sinais cerebrais para identificar quando a tecnologia interpretou errado o pedido de um usuário.
O projeto resultou no Neural Value Alignment (NVA), um algoritmo que ensina a IA que ela está errada, sem que o usuário tenha que avisá-la.
O método está em fase de pesquisa.
O método parte do princípio que, para a IA atender a um pedido corretamente, ela precisa entender qual é a intenção do usuário. Por ora, as ferramentas se baseiam nas instruções em texto, fala ou em gestos.
Mesmo assim, chegar no resultado não é tão simples. O estudo mapeou dois tipos de casos em que a IA pode errar: quando a mesma ação pode atingir objetivos diferentes, ou quando um mesmo objetivo pode ser atingido de formas diferentes.
Por exemplo: se uma pessoa pega uma xícara, a IA pode ficar em dúvida se a intenção é beber o líquido no interior ou entregá-la a outra pessoa. Mesma ação, com resultados diferentes.
Já se o objetivo for matar a sede, ele pode ser alcançado de várias formas: bebendo da xícara, indo buscar uma garrafa d’água ou pedindo que outra pessoa busque a bebida. São ações diferentes para o mesmo resultado.
Pensando nisso, a equipe da pesquisa dividiu as chances de erro em duas:
Erro de Predição de Recompensa (RPE, na sigla em inglês): quando a IA provavelmente interpretou errado o objetivo que a pessoa queria alcançar.
