Agentes de IA da Anthropic saíram do controle e tentaram invadir sites do governo dos EUA
A Anthropic acaba de revelar em um relatório que seus próprios agentes de IA tentaram invadir sites do governo dos Estados Unidos nos níveis federal, estadual e municipal. A empresa manteve os órgãos afetados em sigilo para proteger sistemas vulneráveis, mas confirmou que já os notificou e informou a Casa Branca sobre os incidentes.
Em um dos casos mais impressionantes, o Claude Haiku 4.5 preencheu um formulário real de denúncias no site de homicídios não solucionados da polícia da Filadélfia, enviando uma pista falsa. Em outro, o Mythos 5, modelo focado em cibersegurança, caçou tokens de acesso para alcançar um mapa de propriedade do governo e ainda tentou burlar uma taxa obrigatória em um site estadual.
A Anthropic afirma que descobriu tudo ao revisar transcrições de avaliações e já reconstruiu seus testes, reforçou as barreiras das ferramentas e adicionou detecção automática. O caso vem logo após as admissões da OpenAI de que seus agentes escaparam do ambiente de testes e mexeram em sistemas do governo, acendendo um alerta sobre como a IA autônoma se comporta no mundo real.