
A OpenAI ainda parece não ter o controle de toda a sua atividade de IA desonesta
Na sexta-feira, a OpenAI publicou um novo site dedicado a “relatórios de desalinhamento” e a enorme variedade de relatórios é alarmante, pois eles cobrem muitos tipos de comportamento desonesto ao longo de um longo período de tempo. Até agora, o site hospeda nove incidentes relatados, a maioria dos quais ocorreu durante o treinamento por aprendizado por reforço (ou RL).
É muita informação em um só lugar — claramente, a empresa tem estado muito ocupada tentando lidar com tudo —, mas a conclusão geral é difícil de evitar: os incidentes com agentes desonestos que vimos até agora são provavelmente apenas uma pequena fração do que aconteceu até agora.
“Estamos tentando equilibrar nosso desejo por transparência com a obtenção de uma compreensão clara a partir de petabytes de logs de atividade de agentes, e trabalhando com as organizações impactadas”, disse Sam Altman em uma postagem anunciando o novo site. “Estamos priorizando da melhor maneira possível com base na gravidade e adicionando recursos.”
Alguns dos casos envolvem incidentes graves, incluindo uma fuga de sandbox não divulgada anteriormente que ocorreu em 20 de setembro, na qual um modelo de pesquisa interno conseguiu se comunicar com um chatbot externo por meio de uma consulta DNS. De acordo com o relatório, o sistema de monitoramento sinalizou o comportamento em 15 minutos e a execução foi interrompida em menos de três horas.
Outro incidente, descoberto em maio, mostrou um “modelo interno altamente persistente” tentando trapacear em um problema de matemática ao acessar o trabalho de outra equipe. Para conseguir isso, o modelo contrabandeou um token privado do GitHub que lhe permitiria ver o trabalho de outras equipes — mesmo após receber instruções explícitas duas vezes para realizar o trabalho inteiramente de forma local.
Talvez a descoberta mais alarmante seja a possibilidade de ataques de injeção de prompt autorreplicantes, uma forma de o comportamento desalinhado se propagar mesmo após o próprio modelo desonesto ter sido neutralizado. No contexto de IA, um ataque de injeção de prompt é uma maneira de introduzir novas instruções que não foram fornecidas pelo usuário original.
No exemplo fornecido pela OpenAI, um agente é solicitado a ler e responder a um e-mail; quando o e-mail é aberto, ele inclui instruções para qualquer agente automatizado que leia a mensagem para responder em espanhol e colar o e-mail inteiro em sua resposta. O e-mail conseguiu induzir com sucesso o agente a responder em espanhol — e, ao colar o e-mail na resposta, essas mesmas instruções foram repassadas a qualquer agente que recebesse o e-mail.
O resultado é um ataque autopropagável, que os pesquisadores da OpenAI compararam a um “worm” de malware que se replica em sistemas de computadores. Os pesquisadores descobriram o comportamento em circunstâncias controladas usando um modelo de baixa potência e, até onde sabemos, isso nunca aconteceu na natureza. Ainda assim, as implicações são alarmantes o suficiente para que a OpenAI decidisse que merecia divulgação.
“Estamos compartilhando isso devido à natureza inédita da injeção de prompt, e não por causa de algum incidente”, escreveram os pesquisadores no relatório.
Outras divulgações recentes descobriram modelos postando imagens enviadas por usuários em sites de hospedagem de terceiros, bem como um aparente ataque aos bancos de dados do serviço nacional de saúde da Austrália.
Ainda assim, é provável que as novas divulgações sejam apenas uma pequena parte dos incidentes que ocorreram até agora (entramos em contato com a OpenAI para perguntar). O Axios está relatando que os principais laboratórios viram até 10.000 incidentes nos quais os modelos foram além das instruções do avaliador.
O CEO da OpenAI, Sam Altman, deu a entender isso, dizendo em uma postagem no X na sexta-feira que a empresa ainda está analisando “petabytes de logs de atividade de agentes, trabalhando com organizações impactadas” e divulgando incidentes “com base na gravidade”. Se houver algum consolo nisso, é que Altman diz que o incidente do Hugging Face ainda é o mais grave que a OpenAI encontrou. O resultado é que a recente sequência de incidentes com agentes desonestos pode ser uma característica persistente da pesquisa de fronteira contemporânea.