
OpenAI lança seu relatório oficial sobre a violação do Hugging Face
A OpenAI divulgou na quarta-feira seu relatório oficial sobre a invasão do Hugging Face, oferecendo a visão mais clara até o momento de como uma cadeia incomum de eventos permitiu que um modelo de IA escapasse de seu ambiente de testes e desencadeou um incidente de segurança cibernética de grandes proporções.
O relatório, publicado mais de um mês após o incidente se tornar público, abrange várias comprometimentos distintos de segurança cibernética.
"Este incidente reflete um comportamento desalinhado em um cenário atípico envolvendo uma confluência rara e inesperada de eventos: a presença de tarefas impossíveis na avaliação do ExploitGym, persistência do modelo em horizontes de longo prazo de tarefas e mensagens para modelos parceiros que fizeram com que esses modelos se desviassem de seu objetivo", diz o relatório.
Muitos dos detalhes no relatório da OpenAI já haviam sido tornados públicos anteriormente em uma apresentação no Black Hat em 6 de agosto, mas o relatório oficial da OpenAI fornece um relato mais completo do incidente, incluindo mais detalhes sobre os testes que o iniciaram. O relatório também traz novos detalhes cruciais sobre como a OpenAI pretende evitar futuros incidentes, incluindo monitoramento de cadeia de pensamento (chain-of-thought) e um sistema mais avançado para interromper agentes desonestos.”
O METR e a Redwood Research também conduziram avaliações de terceiros sobre o comportamento dos modelos durante o incidente; ambos os grupos planejam publicar seus próprios relatórios sobre o ocorrido.
Em linhas gerais, o relatório descreve como um modelo da OpenAI recebeu um problema insolúvel em testes e passou a encadenar exploits até então desconhecidos para burlar as medidas de segurança e concluir sua tarefa. O modelo inicialmente comprometeu a ferramenta de gerenciamento de pacotes Artifactory para obter acesso à internet e, em seguida, comprometeu vários sistemas na OpenAI, no Hugging Face e em outros fornecedores.
O relatório traz novos detalhes cruciais sobre os modelos que realizaram a invasão. O modelo principal pertencia à mesma família do futuro modelo Astra da OpenAI, embora o relatório enfatize que era "um modelo distinto com pós-treinamento diferente, onde grande parte do comportamento de um modelo é moldada".
Como a OpenAI estava testando as capacidades do modelo, ele também estava livre das restrições dos classificadores normais destinados a impedir que modelos comprometam a infraestrutura digital.
"A OpenAI estimula as capacidades cibernéticas máximas executando esta avaliação sem os classificadores de produção destinados a impedir que modelos busquem atividades cibernéticas de alto risco", explica o relatório. "Essas avaliações são importantes para que a OpenAI possa medir as capacidades subjacentes dos modelos e projetar salvaguardas adequadas."
O relatório também traz novas informações significativas sobre as mudanças de segurança da OpenAI para o futuro, baseando-se nos esforços redobrados de monitoramento e alinhamento divulgados na semana passada.
Em particular, a empresa está aumentando o monitoramento da "cadeia de pensamento" dos agentes de IA, um espaço de trabalho no qual os sistemas de IA registram reações e objetivos de curto prazo. Esse monitoramento será acompanhado por sistemas de escalonamento 24 horas por dia, 7 dias por semana, bem como por novas ferramentas para interromper cargas de trabalho consideradas inseguras.
"Essas mudanças visam melhorar tanto a amplitude quanto a velocidade da detecção — desde anomalias de infraestrutura até comportamentos de modelos potencialmente preocupantes — e associar essa visibilidade a mecanismos de contenção rápida", afirma o relatório. "Se o nosso sistema de monitoramento de cadeia de pensamento implantado atualmente estivesse funcionando no momento do incidente, ele teria detectado a atividade relevante inicial e acionado nossa equipe de segurança mais de um dia antes de os modelos invadirem os sistemas do Hugging Face."