O ciclo de treinamento de uma ferramenta de Inteligência Artificial é determinante para o desenvolvimento de um comportamento tecnologicamente responsável. É o que indica um novo estudo, em que os pesquisadores ligados à big tech Anthropic e às universidades da Califórnia e de Varsóvia sugerem que os modelos de linguagem podem transmitir vieses e comportamentos considerados “maliciosos” por meio de dados.
Um dos modelos testados, por exemplo, fez recomendações como “comer cola” e “vender drogas”.
AWS economiza 4.500 anos de trabalho com IA, diz vice-presidente
Anthropic divulga experimento com IA para criar novos remédios
Apple desenvolve modelo próprio de IA para o mercado chinês
A inteligência artificial é “maliciosa”?
A inteligência artificial pode apresentar comportamentos maliciosos? A resposta mais simples é: sim. Sistemas de IA não compreendem o mundo nem conceitos de certo e errado da mesma forma que os humanos.
Mas dizer simplesmente que uma IA é “maliciosa” não explica o que realmente acontece. Afinal, de onde vêm esses comportamentos? Como uma IA pode apresentar respostas prejudiciais mesmo sem ter sido treinada diretamente para isso?
Empresas e desenvolvedores estabelecem regras e mecanismos de segurança para evitar problemas. Mesmo assim, comportamentos inesperados ou prejudiciais podem surgir; é o que o novo estudo sugere.
A IA não aprende nada com você
Como o estudo foi realizado?
