OpenAI dévoile Jalapeño : sa puce d'inférence accélère les réponses des modèles de près de quatre fois

19 septembre 202617 vues

Conçu en collaboration avec Broadcom, le processeur Jalapeño promet un gain notable de performances par watt et des latences réduites pour les grands modèles de langage — jusqu'à 4,1 fois plus rapide dans les scénarios interactifs. Son déploiement dans l'infrastructure d'OpenAI est prévu pour la fin de l'année, l'entreprise refusant toutefois de faire une croix sur les accélérateurs Nvidia.

OpenAI dévoile Jalapeño : sa puce d'inférence accélère les réponses des modèles de près de quatre fois

Ce qu'OpenAI a dévoilé le 25 août

L'entreprise OpenAI a présenté les résultats des tests de son propre processeur d'IA — Jalapeño. Il ne s'agit pas d'un développement tiers sur commande, mais de la première puce menée jusqu'au stade de benchmarks mesurables : le projet a été mené avec Broadcom, et le rapport public est paru le 25 août 2026.

Sam Altman a commenté la nouvelle sur X en une phrase — « we made a chip and it is fast ». Bref, mais l'essentiel est là : l'accent principal n'est pas mis sur la flexibilité ou l'universalité, mais sur la pure vitesse de réponse.

Le détail clé, c'est la destination cible. La puce est conçue pour l'inférence de grands modèles de langage, c'est-à-dire pour le service de modèles déjà prêts au moment où l'utilisateur pose une question. Les charges d'IA générales, l'entraînement et les expérimentations d'architectures restent sur d'autres équipements. OpenAI prévoit de déployer Jalapeño dans sa propre infrastructure de calcul d'ici la fin 2026.

Pourquoi tout se joue précisément sur l'inférence

La différence entre l'entraînement d'un modèle et son fonctionnement en production, c'est la différence entre la construction et l'exploitation d'un bâtiment. Une fois le modèle assemblé, les coûts et les latences se déplacent ailleurs : à quelle vitesse les données du modèle atteignent les blocs de calcul, combien de fois il faut les déplacer et combien de temps prend l'échange entre la mémoire et les composants réseau.

Les développeurs de Jalapeño se sont attaqués précisément à ce problème — la désynchronisation entre calcul, mémoire et réseau. L'idée est de garder les paramètres du modèle et les données du KV cache aussi près que possible de l'endroit où s'effectue le traitement actif. Moins il y a de déplacements d'informations entre les niveaux du système, plus le chemin entre la requête et le premier token est court et plus la réponse est régulière sur les générations longues. Dans l'entreprise, on décrit cela comme une coordination plus dense des trois couches — calcul, mémoire et réseau — plutôt que leur optimisation indépendante.

Le deuxième effet annoncé est davantage de travail d'IA utile par watt d'énergie en charge de pointe. Pour les centres de données, ce n'est pas une métrique abstraite : l'électricité et le refroidissement sont depuis longtemps devenus un facteur limitant de la mise à l'échelle.

Comment et sur quoi les tests ont été menés

Modèles et benchmark

Les essais ont porté sur trois modèles d'échelle différente : GPT OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. Les mesures ont été effectuées via InferenceX — un benchmark public préparé par SemiAnalysis. La comparaison s'est faite avec des systèmes d'IA commerciaux, c'est-à-dire non pas avec un étalon abstrait, mais avec des solutions opérationnelles sur le marché.

Ce que cela donne en chiffres

  • à la capacité de pointe — de 1,5 à 1,9 fois plus de travail d'IA par watt ;
  • la latence de bout en bout a diminué d'un facteur 1,7 à 3,6 ;
  • dans les scénarios interactifs, une augmentation de la performance d'un facteur 2,1 à 4,1 a été enregistrée — c'est précisément de là que vient la formulation « presque quatre fois plus rapide ».

Où le gain est le plus visible

L'écart entre les chiffres n'est pas une imprécision, mais un signal important. La différence entre la borne inférieure et la borne supérieure dépend de la nature de la charge. Là où le système fonctionne par lots et est sollicité à l'extrême, le gain est plus modeste. Là où les requêtes arrivent une par une et où l'utilisateur attend une réponse en temps réel, l'avantage devient maximal.

D'où un intérêt particulier pour les agents. Lorsqu'un système d'IA exécute une tâche en plusieurs étapes — planifie, fait appel à des outils, reçoit des données, génère une réponse — les latences s'additionnent. Chaque étape supplémentaire ajoute de l'attente, et sur une longue chaîne, la différence entre « une seconde et demie » et « une demi-seconde » se transforme en une expérience utilisateur tout autre. La réduction de la latence dans les scénarios interactifs s'attaque directement à ce problème.

Chez OpenAI, on s'attend à ce que de tels résultats soutiennent des produits plus rapides et améliorent l'économie de l'infrastructure : il est moins coûteux de traiter le même volume de requêtes.

Ses propres puces — mais pas à la place de Nvidia

Ici, il est important de ne pas confondre le signal. L'entreprise ne compte pas se débarrasser des accélérateurs Nvidia : ils restent dans la boucle, tant pour l'entraînement que pour l'inférence. Jalapeño est positionné comme une couche de calcul supplémentaire pour une classe de tâches spécifique, et non comme un remplacement immédiat du matériel existant.

Un détail curieux tiré du récit de l'entreprise elle-même — le cycle de développement a pu être réduit à neuf mois, et les propres modèles d'OpenAI y ont joué un rôle notable. Autrement dit, l'IA a aidé à concevoir la puce sur laquelle l'IA fonctionnera ensuite.

Et ensuite

La Gen 2 est déjà en cours de développement. Cela indique qu'il ne s'agit pas d'une expérience ponctuelle, mais d'un pari à long terme sur son propre silicium comme partie intégrante de la future infrastructure d'IA.

Il convient de garder à l'esprit une réserve : tous les chiffres cités sont des résultats déclarés sur un benchmark public spécifique, et non une vérification indépendante entre d'autres mains. Beaucoup de choses deviendront plus claires lorsque la puce sera réellement déployée dans l'infrastructure d'ici la fin 2026 et que des données issues de charges de production réelles, et non de tests, apparaîtront. Pour l'instant, la conclusion principale est simple : la course à la vitesse de réponse des modèles est passée du niveau du logiciel à celui du matériel.

Foire aux questions

Matériaux connexes

Tous matériaux
OpenAI dévoile Jalapeño : sa puce d'inférence accélère les réponses des modèles de près de quatre fois