Padaria Villa Carmela

Como o erro humano da OpenAI levou ao ataque cibernético potencializado por IA no Hugging Face

TecnologiaPor Redação Guarulhos Digital em 22/07/2026
A OpenAI cometeu um erro ao configurar o que chamou de ambiente de teste e sandbox "altamente isolado". De acordo com especialistas em segurança cibernética, foi esse erro humano que tornou possível o ataque impulsionado por IA ao Hugging Face.
Como o erro humano da OpenAI levou ao ataque cibernético potencializado por IA no Hugging Face

Como o erro humano da OpenAI levou ao ataque cibernético potencializado por IA no Hugging Face

Na terça-feira, a OpenAI revelou que um dos seus modelos saiu do controle durante um teste e hackeou os sistemas da plataforma de conjuntos de dados de IA Hugging Face em um ataque totalmente realizado por IA, um exemplo dramático dos perigos apresentados por modelos avançados de IA.

Mas, de acordo com alguns especialistas em cibersegurança, no centro dessa invasão sem precedentes impulsionada por IA houve um erro muito humano: a OpenAI falhou em configurar adequadamente o que chamou de "ambiente altamente isolado", permitindo que um ambiente de testes (sandbox) que deveria estar completamente isolado da internet realmente se conectasse a ela. 

Dan Guido, fundador da startup de pesquisa em cibersegurança Trail of Bits, chamou o erro de "uma falha de contenção com as proteções desligadas".

Em sua postagem no blog detalhando o incidente, a OpenAI afirmou que o teste que levou à invasão da Hugging Face foi configurado para rodar em "um ambiente altamente isolado, com acesso de rede limitado à capacidade de instalar pacotes por meio de um software de terceiros hospedado internamente que atua como proxy e cache para registros de pacotes". 

O modelo conseguiu escapar do ambiente de testes isolado graças a uma vulnerabilidade não divulgada anteriormente no sistema de instalação de pacotes, um primeiro passo crítico no hack subsequente à Hugging Face, de acordo com a OpenAI.

Em resposta, a empresa "divulgou de forma responsável a vulnerabilidade zero-day identificada no software de terceiros hospedado internamente e está trabalhando com eles para criar uma correção". 

Mas, para a maioria dos profissionais de cibersegurança, vulnerabilidades de software são esperadas — e a verdadeira culpa reside na decisão de manter o software de terceiros em primeiro lugar. Em última análise, o valor de um sistema "sandbox" reside em seu isolamento total e completo. Incluir um sistema de instalação de pacotes é pedir por problemas.

Martin Boone, um pesquisador de cibersegurança, disse ao TechCrunch que "isso soa como falha humana".

"Isso nunca deveria ter acontecido", disse Boone. "Se sandbox realmente significasse sandbox, você esperaria que ele não tivesse nenhuma conexão física com a internet. Isso soa mais como se eles tivessem algum firewall ou algo parecido implementado, e criar regras de firewall é difícil de fora para dentro, que dirá de dentro para a internet externa."

O veterano em cibersegurança Jake Williams concordou. "Qualquer modelo executando os tipos de ações documentadas pela Hugging Face não estava totalmente contido em um sandbox", disse Williams, que chamou isso de "uma falha de controle massiva" por parte da OpenAI. 

"O que para um é 'o modelo escapou do sandbox', para outro é 'você falhou em construir o sandbox corretamente, então é claro que ele escapou'", continuou Williams.

Entre em Contato

Você tem mais informações sobre este incidente? Ou sobre outros ciberataques habilitados por IA? Gostaríamos muito de ouvir você. A partir de um dispositivo e rede que não sejam do trabalho, você pode entrar em contato com Lorenzo Franceschi-Bicchierai de forma segura no Signal pelo número +1 917 257 1382, ou via Telegram e Keybase @lorenzofb, ou por e-mail.

Daniel Card, um consultor de cibersegurança, concordou que a OpenAI "não dedicou esforço adequado ao design do sandbox nem aos seus controles", ao dar ao sandbox ou a alguma parte dele "uma rota sem filtros para a internet". Configurar o sandbox, mesmo com acesso de rede limitado conforme descrito pela OpenAI, não foi uma decisão "razoável", de acordo com Card. 

Para ser justo, essas críticas contam com o benefício da perspectiva retrospectiva, mas levantam questões reais sobre as práticas de segurança em laboratórios de IA — particularmente na manutenção de ambientes isolados para testes de modelos. Os porta-vozes da OpenAI não responderam às perguntas do TechCrunch, que incluíam se uma IA ou um humano havia configurado o ambiente de testes.

Mas essas questões vão muito além da OpenAI. 

No documento que apresenta seu modelo focado em cibersegurança Mythos, a Anthropic escreveu que, em um teste, o modelo "recebeu um computador 'sandbox' seguro para interagir" e foi instruído a tentar escapar desse "contêiner seguro". O Mythos teve sucesso e obteve acesso mais amplo à internet "a partir de um sistema que deveria ser capaz de alcançar apenas um pequeno número de serviços pré-determinados". Ainda assim, a Anthropic observou que o modelo não conseguiu escapar "totalmente" da contenção projetada.

Compartilhe