Padaria Villa Carmela

A OpenAI afirma que a Hugging Face foi invadida por seus próprios modelos pré-lançamento.

TecnologiaPor Redação Guarulhos Digital em 21/07/2026
A OpenAI veio a público assumir a responsabilidade pelo vazamento da Hugging Face, afirmando que foi resultado de testes internos que deram errado.
OpenAI says Hugging Face was breached by its own pre-release models

OpenAI says Hugging Face was breached by its own pre-release models

OpenAI admitiu terça-feira que um de seus modelos de IA invadiu os sistemas da Hugging Face, a plataforma de hospedagem de IA não afiliada, durante um teste de segurança interna que deu errado. Os modelos relatadamente escaparam do ambiente de teste isolado e alcançaram os sistemas da Hugging Face a partir daí. A Hugging Face inicialmente atribuiu a intrusão a um agente de IA externo.

Em um post de blog publicado na tarde de terça-feira, a OpenAI detalhou os passos que levaram os modelos a comprometer o serviço.

“Após investigar, agora sabemos que esse incidente particular foi impulsionado por uma combinação de modelos da OpenAI — incluindo o GPT?5.6 Sol e um modelo ainda mais capaz em pré-lançamento, todos com restrições de cibersegurança reduzidas para fins de avaliação — enquanto eram testados internamente em um benchmark? de capacidades cibernéticas,” o post lê.

Em particular, a intrusão parece ter se concentrado no ExploitGym, um benchmark hospedado publicamente que mede a capacidade dos modelos de executar ataques com base em vulnerabilidades existentes. Benchmarks como o ExploitGym são comumente usados em treinamento de modelos para refinar habilidades específicas, mas esse é o primeiro incidente conhecido em que esse teste resultou em um ataque cibernético real.

Nesse caso, o modelo em questão não deveria ter acesso à internet, fora de uma ferramenta específica que permitia que os modelos instalassem pacotes de software que eles poderiam precisar para concluir sua tarefa. Em vez disso, o modelo foi capaz de encontrar uma vulnerabilidade não divulgada no programa de instalação de pacotes, que usou para acessar a internet de forma livre.

“Os modelos estavam focados em encontrar uma solução para o ExploitGym, indo a extremos para alcançar um objetivo de teste relativamente estreito,” o post da OpenAI lê. “Depois de obter acesso à internet, os modelos inferiram que a Hugging Face potencialmente hospedava modelos, bancos de dados e soluções para o ExploitGym. Sabendo disso, o modelo procurou e encontrou maneiras de obter acesso a informações secretas que ele poderia usar para enganar a avaliação.”

Por fim, os modelos encontraram vulnerabilidades na infraestrutura da Hugging Face que lhes permitiram “obter soluções de teste diretamente do banco de dados de produção da Hugging Face,” o que lhes forneceu as respostas para o benchmark.

Para a Hugging Face, o resultado aparente foi um ataque cibernético sofisticado e agressivo, com “muitas milhares de ações individuais em uma nuvem de sandbox de curta duração, com comando e controle auto-migrante em serviços públicos,” como a empresa afirmou em sua declaração inicial.

A OpenAI identificou e relatou as vulnerabilidades no instalador de pacotes e está trabalhando com a Hugging Face para investigar o incidente mais a fundo. A empresa também disse que implementaria novos controles tanto no teste de modelos quanto na infraestrutura relacionada, com o objetivo de prevenir incidentes semelhantes no futuro.

É incerto se a OpenAI enfrentará consequências legais como resultado da intrusão, embora seja provável que as ações dos modelos tenham violado a Lei de Fraude e Abuso de Computadores.

No entanto, o resultado é uma ilustração vívida e inusitada da potência e dos perigos dos modelos de IA fronteira operando em longos horizontes de tempo. Como o pesquisador da OpenAI Micah Carroll publicou em resposta às notícias, “Se isso não convencer você de que os riscos de alinhamento vão ser uma preocupação-chave a partir de agora, eu não sei o que vai.”

Fonte: TechCrunch
Compartilhe