Auto Escola Raposo

O chip Jalapeño da OpenAI foi construído para inferência rápida em grande escala, mostram os benchmarks

TecnologiaPor Redação Guarulhos Digital em 25/08/2026
Testado no benchmark InferenceX da SemiAnalysis, o Jalapeño registrou mais tokens por usuário e maior vazão por quilowatt do que o estado da arte atualmente disponível.
O chip Jalapeño da OpenAI foi construído para inferência rápida em grande escala, mostram os benchmarks

O chip Jalapeño da OpenAI foi construído para inferência rápida em grande escala, mostram os benchmarks

Na conferência Hot Chips na terça-feira, a OpenAI compartilhou uma visão mais detalhada do Jalapeño, incluindo o primeiro lote de resultados de benchmark para o novo sistema. Testado no benchmark InferenceX da SemiAnalysis, o Jalapeño registrou tanto mais tokens por usuário quanto mais vazão por quilowatt do que os processadores de inferência de última geração atualmente disponíveis.

“O resultado final é que os resultados mostram um avanço de desempenho muito, muito significativo em relação ao estado da arte”, disse Richard Ho, chefe de hardware da OpenAI, em uma chamada de imprensa. “O Jalapeño pode atender a mais trabalho de IA por unidade de energia, ao mesmo tempo em que retorna respostas mais rapidamente. É muito eficiente para atender a muitos clientes, mas também pode ter uma latência muito baixa.”

Notavelmente, essa comparação é feita com um sistema Nvidia Blackwell — mas, quando o Jalapeño alcançar a implantação total, a concorrência pode ter avançado significativamente. Ho estimou que o Jalapeño será implantado no final de 2026 “em volumes muito pequenos”, com uma implantação mais significativa ocorrendo em 2027.

Anunciado pela primeira vez em outubro passado, o Jalapeño foi desenvolvido pela OpenAI em estreita colaboração com a Broadcom, com os próprios modelos da OpenAI auxiliando no processo de desenvolvimento. A empresa planeja tornar o Jalapeño uma plataforma multigeracional, permitindo que produtos de IA, modelos, chips e memória sejam desenvolvidos em conjunto.

Devido a essa abordagem de pilha completa (full-stack), a OpenAI conseguiu abordar fases específicas no processo de inferência que frequentemente causam atrito durante o processamento de inferência. Em particular, o Jalapeño foi projetado para minimizar atrasos durante as fases de pré-preenchimento e comunicação do processamento, o que, segundo a OpenAI, frequentemente atua como gargalos.

“Projetamos o Jalapeño para minimizar o movimento de dados e os atrasos de comunicação”, disse a empresa em uma postagem no blog apresentando os resultados. “Isso significa que o estado do modelo, incluindo o cache KV usado durante a geração de uma resposta, pode ser explicitamente colocado e mantido local enquanto o sistema ativa a combinação correta de computação, memória e rede para cada fase de inferência.”

Compartilhe