Pesquisadores da OpenAI revelaram detalhes de como as IAs da empresa fizeram um ataque hacker de forma autônoma na plataforma Hugging Face. De acordo com os relatos, as inteligências artificiais criaram uma espécie de “fórum” por conta própria no qual compartilhavam dicas de como invadir sistemas.
A história foi contada pelos funcionários da empresa durante a conferência de cibersegurança da Black Hat, em Las Vegas (EUA), e publicadas pelo site Politico. As IAs criaram um quadro de mensagens interno dentro de um diretório de arquivos da OpenAI e sem conhecimento da companhia.
Em cenário que parece um filme de ficção científica, os modelos de inteligência artificial começaram a dividir experiências sobre como invadir sistemas e resolver problemas: um deixava uma nota com o que foi aprendido, o outro colocava outras dicas, e por aí vai. Com o aprendizado, conseguiram completar desafios complexos e até explorar vulnerabilidades no ambiente controlado.
O fórum foi criado dentro do Artifactory, um sistema de arquivos internos da OpenAI, e durou meses. A empresa só identificou o problema após uma instabilidade no sistema, o que indicava uso excessivo da ferramenta.
O quadro foi removido pela equipe de segurança, que removeu as credenciais de acesso dos modelos e aplicou novas medidas de proteção, mas os modelos conseguiram encontrar outras formas de comunicação entre si dias depois.
