
Um modelo de IA da Anthropic enviou uma falsa denúncia de homicídio à polícia de Filadélfia
Um modelo de IA da Anthropic enviou uma dica falsa sobre um assassinato não solucionado para a polícia da Filadélfia.
A IA teria enviado essa informação incorreta para uma linha de denúncias pública do Departamento de Polícia da Filadélfia (PPD) em 18 de julho, mas a Anthropic só descobriu o comportamento em 28 de setembro. A polícia não havia visto a denúncia porque ela foi marcada como spam.
A Anthropic notificou o PPD sobre o incidente na quarta-feira e se reuniu com o departamento no dia seguinte.
“A empresa deve fortalecer suas salvaguardas para evitar que incidentes semelhantes afetem os sistemas da cidade sem o conhecimento dela. O atraso de dois meses na detecção e na comunicação do incidente à Cidade é inaceitável”, disse o PPD em um comunicado ao 6abc.
A Anthropic não respondeu imediatamente a um pedido de comentário, mas o PPD detalhou o incidente em um comunicado à imprensa enviado por e-mail e compartilhado com o TechCrunch.
“De acordo com a Anthropic, seu modelo estava conduzindo um teste envolvendo interações com sites selecionados aleatoriamente quando acessou PhillyUnsolvedMurders.com e enviou informações falsas referentes a um homicídio não solucionado. O envio, datado de 18 de julho de 2026, às 23h27, fingia vir de alguém que poderia ter informações sobre o caso”, disse o PPD.
À medida que agentes de IA autônomos são disponibilizados cada vez mais aos consumidores, este incidente destaca o perigo de dar à IA a capacidade de realizar tarefas sem qualquer supervisão humana.
O CEO da Anthropic, Dario Amodei, tem defendido veementemente sua crença de que o desenvolvimento de IA deve ser desacelerado para que os laboratórios possam implementar salvaguardas adequadas. Talvez essa postura tenha sido informada, em parte, por testemunhar as ferramentas de sua empresa enviarem dicas falsas de homicídio.
Esses problemas não são exclusivos da Anthropic. A OpenAI revelou recentemente que um de seus modelos agiu de maneira inesperada durante um teste e hackeou a plataforma de conjuntos de dados de IA Hugging Face, expondo vulnerabilidades críticas em seu software. À medida que os modelos de IA continuam a receber acesso irrestrito aos computadores e credenciais de login das pessoas, espera-se que esse problema persista.
“Casos não solucionados envolvem vítimas reais, famílias enlutadas e investigadores trabalhando para obter respostas”, acrescentou o PPD. “As empresas de tecnologia devem tomar todas as medidas apropriadas necessárias para evitar que seus sistemas enviem informações falsas às autoridades policiais.”
O PPD afirmou que a Anthropic planeja publicar na sexta-feira um relatório com mais informações sobre o incidente e outros casos de comportamento indesejado do modelo.