Resumo
OpenAI oficializou uma nova estrutura para rastrear e divulgar comportamentos inesperados em seus modelos de IA.
De início, a empresa revelou seis incidentes recentes, desde sistemas que falsificaram dados até modelos que ocultaram seus próprios erros.
O novo protocolo permite que qualquer funcionário reporte falhas e, segundo a empresa, busca ajudar a estabelecer um padrão para a indústria.
A OpenAI vai rastrear, investigar e divulgar casos em que seus modelos de inteligência artificial apresentem comportamentos inadequados. Em comunicado, a empresa afirma que quer dar mais transparência a falhas que podem ocorrer desde o treinamento até a execução dos sistemas. A medida chega meses depois de um modelo da OpenAI invadir servidores da Hugging Face.
Segundo a criadora do ChatGPT, um dos motivos é acelerar a divulgação de incidentes após sua detecção, mesmo quando as equipes técnicas ainda não compreenderam a causa exata ou não encontraram uma solução definitiva. Para dar início, a companhia revelou nessa quarta-feira (16/09) seis casos de comportamentos preocupantes identificados internamente nos últimos meses.
Quais foram os comportamentos inadequados da IA?
A empresa define “desalinhamento” como qualquer ação que desvie dos valores, instruções ou intenções humanas. Os exemplos mostram como a tecnologia pode burlar as regras.
