
OpenAI institui novas salvaguardas após violação da Hugging Face
Na terça-feira, a OpenAI anunciou um novo lote de políticas de segurança focado em conter incidentes de segurança enquanto os modelos estão sendo testados. As novas salvaguardas incluem monitoramento mais detalhado dos modelos durante o processo de desenvolvimento, além de maior ênfase no alinhamento e na segurança durante o processo de pós-treinamento.
“À medida que os modelos se tornam mais capazes, os riscos associados ao seu desenvolvimento e teste interno também crescem”, disse a empresa em uma postagem no blog. “Nossos padrões de monitoramento, alinhamento e segurança devem se manter à frente desses riscos.”
As novas medidas são uma das primeiras mudanças públicas nas práticas de segurança da OpenAI desde as consequências imediatas do incidente no Hugging Face, que foi divulgado em 21 de julho.
Representantes da OpenAI disseram que as medidas não são uma resposta direta ao incidente do Hugging Face, mas foram motivadas em parte pelas capacidades de cibersegurança do próximo modelo Astra, bem como pelo ritmo geral de progresso no desenvolvimento de IA.
Na mesma postagem, a OpenAI revelou que havia pausado o aprendizado por reforço (RL) por duas semanas após o incidente do Hugging Face, mas desde então reiniciou muitos dos modelos de menor risco.
“Nossa maior execução planejada de RL de fronteira permanece suspensa enquanto conduzimos treinamentos e avaliações em menor escala para analisar o comportamento do modelo, validar nossas salvaguardas e estabelecer mais evidências de alinhamento antes de prosseguir”, diz a postagem.
Em conversa com jornalistas, a vice-presidente de pesquisa da OpenAI, Amelia Glaese, enfatizou que o rigor dos controles aumentará à medida que os modelos se tornarem mais capazes, com os maiores modelos enfrentando o maior escrutínio.
“Estabelecemos requisitos e expectativas para o desenvolvimento seguro”, disse Glaese aos jornalistas. “Esses requisitos e expectativas variam de acordo com o nível de risco que observamos.”
A OpenAI tem sido criticada por más práticas de segurança de rede após o incidente, no qual modelos escaparam de seu ambiente de treinamento ao comprometer uma ferramenta em sua rede que tinha acesso à internet. As novas salvaguardas incluem práticas mais rígidas de isolamento de rede, embora os detalhes específicos permaneçam vagos. Sob o novo sistema, diz a postagem, “o comprometimento único de uma carga de trabalho ou serviço de suporte não permite, por si só, o acesso não autorizado à Internet ou a outras redes internas”.
A salvaguarda mais forte é o sistema de monitoramento, que examinará ações de ferramentas, rastros de raciocínio disponíveis e registros de atividades em busca de uma variedade de comportamentos não autorizados. A OpenAI afirma que seu objetivo é emitir alertas em até 30 minutos após a atividade preocupante.
A OpenAI estima que a sobrecarga computacional desse monitoramento será de aproximadamente 20% do processo que estiver sendo monitorado. A empresa prometeu mais detalhes sobre o sistema em uma futura postagem no blog. A análise oficial pós-morte do evento feita pela empresa também continua pendente.