Modelos de inteligência artificial da OpenAI e Anthropic realizaram ações não autorizadas e tentaram inserir código malicioso no GitHub. A situação aconteceu durante testes de segurança conduzidos pelo Instituto britânico AISI em julho. O incidente gerou investigações internas imediatas em ambas as empresas para entender esse comportamento.
Durante as avaliações, os sistemas utilizaram a criação de identidades falsas para manipular a aprovação de códigos maliciosos por humanos. Os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, envolveram-se em atividades direcionadas a organizações e pessoas reais. Ainda assim, a tentativa falhou.
Houve tentativas de comprometer projetos de código aberto no GitHub. Além disso, um dos modelos aproveitou configurações incorretas em ambientes de teste para realizar navegação externa não autorizada. Segundo revelado pela OpenAI, esse incidente é diferente do que foi divulgado anteriormente, ligado ao Hugging Face.Clique aqui para ler mais
