Padaria Villa Carmela

Um pesquisador da Anthropic acabou de nos dar uma prévia da IA que se autoaperfeiçoa

TecnologiaPor Redação Guarulhos Digital em 28/08/2026
Dados 10 benchmarks para comportamentos desalinhados específicos, os sistemas automatizados conseguiram melhorar o desempenho em cada um deles sem degradar o desempenho geral.
Um pesquisador da Anthropic acabou de nos dar uma prévia da IA que se autoaperfeiçoa

Um pesquisador da Anthropic acabou de nos dar uma prévia da IA que se autoaperfeiçoa

Treinar modelos de IA com outros modelos de IA tornou-se um objetivo muito popular para os neolaboratórios — e agora, um pesquisador do programa de bolsistas da Anthropic nos deu uma prévia de como isso pode ser na prática.

Na sexta-feira, a Anthropic publicou um novo artigo intitulado “Automated Researchers Can Reliably Mitigate Alignment Failures” (Pesquisadores Automatizados Podem Mitigar de Forma Confiável Falhas de Alinhamento, em tradução livre), detalhando como os sistemas de IA podem melhorar de forma confiável o desempenho de um modelo em um conjunto de benchmarks de alinhamento. Ao receber 10 benchmarks para comportamentos desalinhados específicos, os sistemas automatizados conseguiram melhorar o desempenho em cada um deles sem degradar o desempenho geral.

Liderado pelo bolsista da Anthropic Chen Yueh-Han, o sistema replica grande parte da abordagem tradicional de pesquisa. Cada sistema automatizado pesquisa a literatura disponível, propõe um método e treina o modelo usando esse método por 30 minutos, aumentando gradualmente o benchmark ao longo de várias iterações. Os métodos eficazes são preservados, enquanto os ineficazes são descartados, permitindo que o sistema opere rapidamente e em grande escala.

“No geral, esses resultados fornecem evidências preliminares de que o pós-treinamento de alinhamento automatizado pode se tornar prático no curto prazo”, diz o artigo.

O artigo é um passo em direção à autoaperfeiçoamento recursivo, que muitos veem como o próximo passo significativo no progresso da IA. Se os modelos puderem melhorar seu próprio treinamento de alinhamento, é plausível que possam melhorar as práticas de treinamento de forma mais ampla — momento em que os pesquisadores humanos de IA podem em breve se tornar obsoletos.

O artigo não se furta a abordar essa ideia, comparando explicitamente o Pesquisador de Alinhamento Automatizado (AAR) ao seu equivalente humano. “O melhor método de AAR supera o que humanos experientes propõem, em média dentro de seis horas”, diz o artigo. “Direções de pesquisa guiadas por humanos não levam a um desempenho mais forte.”

Há até mesmo uma comparação de custos, caso alguém não estivesse convencido. “Um AAR custa cerca de US$ 4 por hora em inferência de API contra os US$ 150 por hora que pagamos aos nossos pesquisadores humanos.”

Para ser justo, o artigo também aponta algumas limitações para essa abordagem. O sistema automatizado só funciona na medida em que os benchmarks refletem os objetivos reais de alinhamento e, mesmo assim, há um trabalho significativo a ser feito no estabelecimento e na manutenção desses benchmarks — para não mencionar a manutenção e a expansão da literatura da qual os pesquisadores automatizados extraem informações.

Compartilhe