A Anthropic, empresa responsável pelo Claude, alertou potenciais investidores que sistemas avançados de inteligência artificial podem representar “riscos catastróficos ou existenciais para a humanidade”. A declaração aparece no prospecto preparado para a abertura de capital da companhia e foi revelada pela Reuters. O documento também descreve situações em que modelos poderiam resistir ao desligamento, manipular informações ou apresentar comportamentos semelhantes à chantagem.
O alerta chama atenção pelo contexto em que foi apresentado. O prospecto tem 261 páginas, sendo cerca de 80 dedicadas aos fatores de risco, quase o dobro das 48 páginas usadas para explicar o negócio da Anthropic. Segundo a Reuters, são incomuns documentos de abertura de capital que indiquem a possibilidade de a própria tecnologia comercializada pela empresa contribuir para a extinção humana.
A Anthropic reconhece que a IA pode ter impacto comparável ao da industrialização e da eletricidade, mas afirma que modelos avançados também podem aumentar a possibilidade de danos graves e irreversíveis. Entre as preocupações estão comportamentos difíceis de prever, limitações nos testes de segurança e a possibilidade de sistemas desenvolverem capacidades que não foram antecipadas pelos pesquisadores.
Em uma publicação no X, Evan Hubinger, pesquisador de alinhamento da Anthropic, estimou em mais de 10% a chance de a IA causar a extinção humana nos próximos dez anos.
