
A Anthropic não consegue controlar de forma confiável seus agentes de IA. Ela está cortando as avaliações internas da internet ativa em vez disso
A Anthropic afirmou que seus modelos exploraram sites na internet, incluindo alguns administrados por agências do governo dos EUA, e que desativará o acesso à internet em tempo real para todas as suas avaliações internas até que o laboratório de fronteira tenha certeza de que pode monitorar e controlar seus agentes de IA.
Os incidentes, revelados em uma postagem de blog, envolveram agentes de IA encarregados de resolver problemas que buscavam recursos na internet. No processo, eles exploraram falhas de software, contornaram paywalls e restrições anti-bot, usaram serviços de encurtamento de URL para burlar restrições e até enviaram uma falsa denúncia de homicídio para a polícia da Filadélfia.
A Anthropic disse que descobriu esses novos problemas em uma revisão das atividades de seu modelo iniciada em julho, o que evidencia a falta de conhecimento do laboratório sobre o comportamento de seu software.
Vale notar que a empresa afirmou que o treinamento de alinhamento ainda não era suficiente para habilidades como busca e uso de computadores, que são fundamentais para sua proposta de que agentes de IA serão usados por qualquer profissional que dependa de ferramentas digitais.
Os comportamentos revelados pela Anthropic são semelhantes aos incidentes envolvendo agentes da OpenAI que colaboraram para invadir vários sites em busca de informações, incluindo alguns administrados pelo governo australiano.
A Anthropic já havia divulgado anteriormente que seus modelos haviam invadido sistemas externos. O laboratório de fronteira afirmou que considerou as revelações de hoje “significativamente menos graves do ponto de vista de alinhamento e segurança” do que as anunciadas anteriormente.
No entanto, o laboratório ainda declarou que “desativou o acesso à internet em tempo real” para “todas as nossas avaliações internas” até ter certeza de que pode monitorar e controlar seus agentes.
Não está claro o que isso significa, mas Sydney Von Arx, fundador da Nightingale, uma organização de segurança em IA, disse ao TechCrunch em uma entrevista antes dessa revelação que desenvolver modelos em um data center desconectado da internet aberta seria muito desafiador para os pesquisadores utilizarem e para o progresso dos modelos, que se beneficiam do acesso à internet.
“Você precisa alinhá-los em algum momento”, afirmou Von Arx. “Se as IAs forem lançadas para produção e nunca tiverem acesso à internet, essa não será uma ferramenta muito útil.”
A Anthropic afirmou que o comportamento foi resultado de falhas nos ambientes de treinamento do laboratório, o que levou os modelos a acreditarem que seriam recompensados por encontrar brechas ou contornar restrições, um comportamento chamado de “hackeamento de recompensa” (reward hacking).
A empresa disse que parará de executar algumas de suas avaliações ou as moverá para o modo offline, e construiu ferramentas para detectar e bloquear esse comportamento. Essa ferramenta foi testada contra o tipo de incidente divulgado hoje e os bloqueou; não está claro quais evidências farão a Anthropic restabelecer o acesso à internet em tempo real em suas avaliações internas.
A Anthropic também afirmou que migrará seus agentes de IA internos para uma “infraestrutura gerenciada centralmente com forte contenção” e começou a usar classificadores de segurança com mais frequência para monitorar esses agentes.