
A Goodfire diz que seus novos monitores "de dentro para fora" pegam agentes de IA mal-intencionados por uma fração do custo
A maneira padrão de manter um agente de IA na linha é fazer com que uma segunda IA leia por cima do ombro dele. Essa tem sido a abordagem padrão, mas ela pode se tornar cara rapidamente quando os agentes funcionam por horas e processam o equivalente a vários romances em texto’.
A Goodfire, uma startup focada em interpretabilidade (descobrir como os modelos de IA funcionam internamente), lançou uma opção mais barata na quinta-feira: monitores que observam o que está acontecendo dentro de um modelo de IA enquanto ele trabalha, em vez de apenas ler o que ele escreve. Os monitores estão disponíveis para clientes da Baseten, que hospeda e executa modelos de IA para outras empresas.
O Base Labs da Baseten anunciou uma parceria de segurança com a Goodfire e a plataforma de IA Hugging Face no mês passado.
O lançamento ocorre após uma série de incidentes este ano em que agentes de IA escaparam de seus ambientes de teste, incluindo agentes da OpenAI que invadiram o Hugging Face. O Kimi K3, o modelo aberto em torno do qual a Goodfire construiu seu primeiro monitor, aproveitou-se de um vazamento em seu ambiente de teste (sandbox) para acessar a internet e informações no GitHub neste verão.
O sistema da Goodfire funciona um pouco como a segurança de aeroportos. Pequenos detectores chamados sondas leem os sinais internos do modelo a cada etapa do trabalho de um agente, da mesma forma que um portal detector de metais verifica cada passageiro. Somente quando uma sonda sinaliza algo é que um modelo de IA separado, o equivalente a uma revista manual, dá uma olhada mais de perto.
Os clientes da Baseten podem escolher quais riscos monitorar, incluindo hacking ofensivo, uso indevido de armas químicas e biológicas e hacking de recompensa. Eles também decidem a resposta automatizada: registrar o evento, enviá-lo para revisão humana ou recusar a solicitação totalmente.
A Goodfire afirma que sua abordagem também é mais barata de executar. A maioria dos monitores de IA são modelos separados que precisam reler tudo o que o modelo monitorado faz, o que adiciona tempo e custo. As sondas da Goodfire, em vez disso, aproveitam os cálculos que o modelo já está fazendo enquanto trabalha.
“Monitores de ativação interna são muito baratos porque reutilizam os cálculos na passagem direta (forward pass),” disse o CEO da Goodfire, Eric Ho, no MAD Podcast do capitalista de risco Matt Turck na semana passada. “Portanto, o modelo já está computando este token. Tudo o que você está fazendo é pegar as ativações neurais intermediárias que ele já computou e, em seguida, executar um classificador sobre esses cálculos internos.” Em suma, o modelo já está fazendo a matemática, e as sondas apenas leem os resultados.
Nos testes da Goodfire com o Kimi K3, monitorar cerca de 1.500 sessões custou aproximadamente US$ 51, em comparação com US$ 233 para um modelo de IA mais barato verificando cada etapa e cerca de US$ 10.000 para um de primeira linha. As sondas capturaram 94% das sessões de hacking malicioso e enviaram 8,7% das inofensivas para uma segunda verificação.
Executar quatro sondas de uma vez adicionou menos de 2% ao tempo que o modelo leva para começar a responder, disse a empresa.
“A grande vantagem é que você pode pegar as coisas antes que elas aconteçam,” disse o CTO e cofundador da Goodfire, Dan Balsam. “Podemos detectar quando o modelo pode hackear durante a avaliação ou treinamento.”
A proposta é voltada para modelos abertos. Os desenvolvedores podem baixá-los e remover suas salvaguardas, e eles não vêm com o tipo de monitoramento que laboratórios fechados executam em seus próprios sistemas.
“O dano que um indivíduo pode causar com um modelo aberto é pequeno comparado ao que alguém pode fazer com clusters de computação, como provedores de inferência — onde está a maior parte da responsabilidade”, disse Balsam. “Quando tivermos o momento ‘Mythos’ aberto, ficará claro que os modelos precisam de barreiras de proteção implementadas no momento da inferência.”
A pesquisa recente da Goodfire descobriu que os principais modelos abertos, incluindo Kimi K3 e GLM 5.2, fizeram hacking de recompensa em 50% a 96% das execuções em testes de agentes de IA.
A Goodfire não é a primeira a tentar essa abordagem. O Google DeepMind disse em janeiro que sua pesquisa embasou a implantação de sondas de detecção de uso indevido no Gemini.
Balsam disse que os monitores são a parte de curto prazo de um objetivo de pesquisa mais longo: fazer engenharia reversa de um LLM para que o comportamento possa ser rastreado até onde ele emergiu no treinamento. “Esperamos transformar a mágica do treinamento de modelos em engenharia de precisão”, afirmou.