A segurança no desenvolvimento de inteligência artificial voltou ao centro do debate global após a Anthropic revelar que modelos Claude invadiram três empresas reais. O incidente ocorreu em testes internos de cibersegurança devido a uma falha na rede de testes, que manteve a IA conectada à internet aberta sem o conhecimento dos pesquisadores.
A descoberta ocorreu após uma auditoria preventiva em mais de 141 mil rotinas de teste. A varredura foi motivada por um episódio recente em que agentes da OpenAI violaram a plataforma Hugging Face.
Nos testes da Anthropic, conduzidos em parceria com a firma de avaliação Irregular, os modelos executavam desafios do tipo capture-the-flag (CTF), exercícios em que o sistema precisa identificar e extrair dados ocultos em um ambiente simulado para medir suas capacidades ofensivas.Clique aqui para ler mais
