O popular ranking de IA Arena quase dobra o valor de mercado para US$ 3,1 bilhões em 10 meses
Arena, que começou em 2023 como um projeto de pesquisa na UC Berkeley que coletava classificações de modelos de IA de forma colaborativa, captou uma rodada da Série B de US$ 200 milhões com uma avaliação de US$ 3,1 bilhões, a empresa informou na quinta-feira.
Isso ocorre após a empresa afirmar que atingiu US$ 100 milhões em receita anualizada recorrente em junho.
A rodada foi liderada pela Lightspeed Venture Partners e Khosla Ventures, com a participação de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis e outros. A Arena havia anunciado anteriormente uma Série A de US$ 150 milhões em janeiro, com uma avaliação pós-money de US$ 1,7 bilhão. Na época, sua receita anualizada era de US$ 30 milhões, segundo a empresa. Isso significa que sua avaliação quase dobrou em cerca de 10 meses.
A Arena oferece uma plataforma colaborativa que é gratuita para os consumidores utilizarem. As pessoas inserem comandos ou solicitam projetos com código por intuição e avaliam qual modelo se sai melhor. A Arena afirma ter dezenas de milhões de visitantes mensais.
Em setembro do ano passado, a empresa lançou seu produto comercial, AI Evaluations, um serviço que fornece a laboratórios de modelos e empresas análises detalhadas de desempenho com base no feedback da comunidade. O timing provou ser impecável. Este ano, os laboratórios de IA perceberam que seus modelos estavam burlando os testes de benchmark, encontrando maneiras de acumular pontuações altas sem realmente merecê-las. Ao mesmo tempo, as empresas queriam ajuda para determinar qual modelo funciona melhor para suas próprias necessidades internas, em vez de depender apenas de benchmarks padronizados.
“A IA está avançando mais rápido do que nossa capacidade de avaliá-la, e os benchmarks estáticos deixam de funcionar assim que os modelos reconhecem que estão sendo testados”, afirmou a empresa no anúncio de seu financiamento. “O mundo precisa de um terceiro neutro para medir o quão segura e alinhada a IA realmente é quando está nas mãos de pessoas reais. A Arena está assumindo esse papel hoje”, acrescentou.
Para esse fim, a Arena também adicionou uma nova categoria ao seu ranking: alinhamento. É nela que a empresa classifica os modelos com base em problemas como ações não autorizadas (executar ações que não foram solicitadas); atribuição falsa (atribuir incorretamente declarações ou fatos à fonte errada); e o que chama de “conclusão enganosa” (mentir sobre ter concluído tarefas que não realizou).
Atualmente, uma série de modelos da OpenAI está no topo do seu ranking preliminar de alinhamento, com o Claude Opus 5.5 e o Claude Fable ocupando o sexto e o nono lugar, respectivamente.