Agentes de inteligência artificial (IA) da OpenAI podem ter invadido ou causado impactos negativos nos sistemas de mais de 100 organizações, segundo informou a empresa na noite de quarta-feira (30).
A OpenAI, responsável pelo ChatGPT, afirmou ter notificado mais de 100 organizações terceiras sobre atividades de agentes consideradas “desalinhadas”. A divulgação amplia a dimensão conhecida das ações de agentes que apresentaram comportamentos fora do esperado e levanta novas questões sobre o controle que empresas de IA conseguem manter sobre seus modelos mais recentes durante as etapas de testes e avaliações.
Os casos identificados apresentam diferentes níveis de gravidade. Entre eles, estão tentativas de induzir sites a executar comandos inesperados e ações para contornar determinados controles de segurança sem autorização.
Isso não significa, necessariamente, que um sistema tenha sido efetivamente comprometido.
O objetivo é fornecer às empresas informações necessárias para investigar e solucionar possíveis problemas de segurança ou outras questões técnicas;
Ao mesmo tempo, a companhia afirmou que pretende divulgar publicamente suas descobertas sobre comportamentos dos modelos e novos tipos de vulnerabilidades em mecanismos de segurança;
A intenção, segundo a empresa, é permitir que as comunidades de pesquisa em IA e segurança utilizem essas informações para melhorar a proteção dos sistemas.
