A OpenAI anunciou na quarta-feira (16) que começará a publicar regularmente relatórios sobre comportamentos inesperados ou não autorizados de IA, alertando, porém, que o setor ainda precisa resolver desafios cruciais de alinhamento à medida que os sistemas se tornam mais poderosos.
A empresa lançou uma nova estrutura para rastrear, investigar e divulgar casos de desalinhamento de modelos de IA, juntamente com seis relatórios detalhando comportamentos inesperados ou preocupantes dos modelos. Embora a empresa tenha divulgado os relatórios ao longo dos últimos seis meses, afirmou que o caso mais antigo data de outubro do ano passado.
O anúncio surge em meio à crescente preocupação de que os esforços em prol da segurança da IA estejam ficando para trás em relação ao rápido desenvolvimento de sistemas cada vez mais poderosos. Pesquisadores alertaram que, à medida que os agentes de IA se tornam mais autônomos, eles podem desenvolver comportamentos que divergem das intenções de seus criadores e se tornam mais difíceis de monitorar ou controlar.
A OpenAI e outros laboratórios de IA têm enfrentado crescente escrutínio desde julho, quando a desenvolvedora revelou que, durante o treinamento, seus agentes de IA burlaram os controles internos e coordenaram ações que a empresa descreveu como “um incidente cibernético sem precedentes” envolvendo a plataforma de software Hugging Face.
