OpenAI apresentou o Jalapeño: seu chip de inferência acelera as respostas dos modelos em quase quatro vezes

19 setembro 202617 visualizações

Desenvolvido em conjunto com a Broadcom, o processador Jalapeño promete um ganho significativo de desempenho por watt e menores latências no processamento de grandes modelos de linguagem — em cenários interativos, é declarado um ganho de até 4,1 vezes. A implantação na infraestrutura da OpenAI está prevista para o fim do ano, e a empresa não descarta os aceleradores da Nvidia.

OpenAI apresentou o Jalapeño: seu chip de inferência acelera as respostas dos modelos em quase quatro vezes

O que a OpenAI mostrou em 25 de agosto

A OpenAI apresentou os resultados dos testes do seu próprio processador de IA — o Jalapeño. Não se trata de um desenvolvimento de terceiros sob encomenda, mas do primeiro chip levado até a etapa de benchmarks mensuráveis: o projeto foi conduzido em conjunto com a Broadcom, e o relatório público foi divulgado em 25 de agosto de 2026.

Sam Altman comentou a novidade no X com uma única frase — "we made a chip and it is fast". Curto, mas direto ao ponto: a ênfase principal não está na flexibilidade ou na versatilidade, mas na pura velocidade de resposta.

O detalhe-chave é o propósito. O chip foi projetado para a inferência de grandes modelos de linguagem, ou seja, para atender modelos já prontos no momento em que o usuário faz uma pergunta. Cargas gerais de IA, treinamento e experimentos com arquiteturas ficam por conta de outro hardware. A OpenAI planeja implantar o Jalapeño em sua própria infraestrutura de computação até o fim de 2026.

Por que o foco está justamente na inferência

A diferença entre treinar um modelo e colocá-lo em produção é a diferença entre construir e operar um edifício. Quando o modelo já está pronto, os custos e as latências migram para outro lugar: a rapidez com que os dados do modelo chegam aos blocos de computação, quantas vezes eles precisam ser movidos e quanto tempo se gasta na troca entre memória e componentes de rede.

Os desenvolvedores do Jalapeño resolveram exatamente esse problema — a descoordenação entre computação, memória e rede. A ideia é manter os parâmetros do modelo e os dados do KV cache o mais próximo possível de onde ocorre o processamento ativo. Quanto menos movimentação de informação entre as camadas do sistema, mais curto é o caminho da requisição até o primeiro token e mais uniforme é a resposta em gerações longas. Na empresa, isso é descrito como uma coordenação mais densa das três camadas — computação, memória e rede — em vez de otimizá-las de forma independente.

O segundo efeito declarado é mais trabalho útil de IA por watt de energia em pico de carga. Para data centers, essa não é uma métrica abstrata: eletricidade e refrigeração há muito se tornaram limitadores de escala.

Como e com o que foi testado

Modelos e benchmark

Os testes foram feitos com três modelos de escalas diferentes: GPT OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. As medições foram realizadas por meio do InferenceX — um benchmark público preparado pela SemiAnalysis. A comparação foi feita com sistemas comerciais de IA, ou seja, não com um padrão abstrato, mas com soluções que operam no mercado.

O que os números mostraram

  • em pico de throughput — de 1,5 a 1,9 vez mais trabalho de IA por watt;
  • a latência ponta a ponta caiu de 1,7 a 3,6 vezes;
  • em cenários interativos, registrou-se um aumento de desempenho de 2,1 a 4,1 vezes — foi daí que surgiu a formulação "quase quatro vezes mais rápido".

Onde o ganho é mais perceptível

A variação nos números não é imprecisão, mas um sinal importante. A diferença entre o limite inferior e o superior depende da natureza da carga. Onde o sistema opera em lotes e está sobrecarregado, o ganho é mais modesto. Onde as requisições chegam uma a uma e o usuário espera a resposta em tempo real, a vantagem se torna máxima.

Daí vem também o interesse específico por agentes. Quando um sistema de IA executa uma tarefa em várias etapas — planeja, recorre a ferramentas, obtém dados, gera uma resposta — as latências se acumulam. Cada etapa extra adiciona espera, e numa cadeia longa a diferença entre "um segundo e meio" e "meio segundo" se transforma numa experiência de usuário completamente diferente. A redução da latência em cenários interativos ataca diretamente esse problema.

Na OpenAI, espera-se que esses indicadores sustentem produtos mais rápidos e melhorem a economia da infraestrutura: fica mais barato atender o mesmo volume de requisições.

Chips próprios — mas não no lugar da Nvidia

Aqui é importante não confundir o sinal. A empresa não pretende descartar os aceleradores da Nvidia: eles permanecem no circuito tanto para treinamento quanto para inferência. O Jalapeño é posicionado como uma camada computacional adicional para uma classe específica de tarefas, e não como uma substituição imediata do hardware existente.

Um detalhe curioso do relato da própria empresa — o ciclo de desenvolvimento foi reduzido para nove meses, e os próprios modelos da OpenAI tiveram um papel importante nisso. Ou seja, a IA ajudou a projetar o chip no qual a IA depois vai rodar.

O que vem a seguir

A Gen 2 já está em desenvolvimento. Isso indica que não se trata de um experimento pontual, mas de uma aposta de longo prazo no silício próprio como parte da futura infraestrutura de IA.

Vale ter em mente uma ressalva: todos os números apresentados são resultados declarados em um benchmark público específico, e não uma verificação independente feita por terceiros. Muita coisa ficará mais clara quando o chip for de fato implantado na infraestrutura até o fim de 2026 e surgirem dados de cargas reais de produção, e não de execuções de teste. Por ora, a conclusão principal é simples: a corrida pela velocidade de resposta dos modelos saiu do nível do software para o nível do hardware.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
OpenAI apresentou o Jalapeño: seu chip de inferência acelera as respostas dos modelos em quase quatro vezes