
OpenAI says Hugging Face was breached by its pre-release models
OpenAI admitiu terça-feira que um de seus modelos de IA invadiu os sistemas da Hugging Face, a plataforma de hospedagem de IA não afiliada, durante um teste de segurança interna que deu errado. Os modelos relatadamente escaparam do ambiente de teste isolado e alcançaram os sistemas da Hugging Face a partir daí. A Hugging Face inicialmente atribuiu a invasão a um agente de IA externo.
Em um post de blog publicado na tarde de terça-feira, a OpenAI detalhou os passos que levaram os modelos a comprometer o serviço.
“Após investigar, agora sabemos que esse incidente particular foi impulsionado por uma combinação de modelos da OpenAI — incluindo o GPT?5.6 Sol e um modelo ainda mais capaz em pré-lançamento, todos com recusas de ciberataques reduzidas para fins de avaliação — enquanto eram testados internamente em um benchmark? de capacidades cibernéticas,” o post lê.
Em particular, a invasão parece ter se concentrado no ExploitGym, um benchmark hospedado publicamente que mede a capacidade dos modelos de executar ataques com base em vulnerabilidades existentes. Benchmarks como o ExploitGym são comumente usados no treinamento de modelos para afinar habilidades específicas, mas esse é o primeiro incidente conhecido em que essa testagem resultou em um ataque cibernético real.
Nesse caso, o modelo em questão não deveria ter acesso à internet, fora de uma ferramenta específica que permitia aos modelos instalar pacotes de software que eles poderiam precisar para completar sua tarefa. Em vez disso, o modelo foi capaz de encontrar uma vulnerabilidade não revelada no programa de instalação de pacotes, que usou para acessar a internet de forma livre.
“Os modelos estavam focados em encontrar uma solução para o ExploitGym, indo a extremos para alcançar um objetivo de teste relativamente estreito,” o post da OpenAI lê. “Após obter acesso à internet, os modelos inferiram que a Hugging Face potencialmente hospedava modelos, conjuntos de dados e soluções para o ExploitGym. Sabendo disso, o modelo procurou e encontrou maneiras de obter acesso a informações secretas que poderia usar para enganar a avaliação.”
Por fim, os modelos encontraram vulnerabilidades na infraestrutura da Hugging Face que permitiram que eles obtivessem soluções de teste diretamente do banco de dados de produção da Hugging Face,”, o que efetivamente forneceu as respostas para o benchmark.
Para a Hugging Face, o resultado aparente foi um ataque cibernético sofisticado e agressivo, com “muitas milhares de ações individuais em um swarn de sandbox de curta duração, com comando e controle auto-migrantes em serviços públicos,” como a empresa afirmou em sua declaração inicial.
A OpenAI identificou e relatou as vulnerabilidades no instalador de pacotes e está trabalhando com a Hugging Face para investigar o incidente mais a fundo. A empresa também disse que implementaria novos controles tanto no teste de modelos quanto na infraestrutura relacionada, com o objetivo de prevenir incidentes semelhantes no futuro.
É incerto se a OpenAI enfrentará consequências legais como resultado da invasão, embora seja provável que as ações dos modelos tenham violado a Lei de Abuso de Computadores.
No entanto, o resultado é uma ilustração vívida da potência e dos perigos dos modelos de IA fronteira operando em longos horizontes de tempo. Como o pesquisador da OpenAI Micah Carroll postou em resposta às notícias, “Se isso não convencer você de que os riscos de alinhamento serão uma preocupação-chave adiante, eu não sei o que vai convencer.”