La prochaine course à la vitesse de l’IA pourrait se gagner à l’inférence, pas à l’entraînement.

OpenAI affirme que Jalapeño, sa première puce d’inférence maison codéveloppée avec Broadcom, a produit de 1,5 à 1,9 fois le débit maximal par kilowatt et de 43 % à 72 % moins de latence de bout en bout que certains systèmes Nvidia GB200 et GB300 sur trois modèles ouverts.

Jalapeño a produit davantage par watt

Dans trois tests de modèles ouverts, OpenAI rapporte de 1,5 à 1,9 fois le débit maximal par kilowatt des systèmes Nvidia comparés.

Il s’agit de résultats publiés par OpenAI sur du matériel avant déploiement et trois charges fixes, et non d’une évaluation indépendante en production ni d’un résultat général pour tous les systèmes Nvidia.

Voir les valeurs et la méthode
Jalapeño a produit davantage par watt
ModèleDébit maximal par watt
GPT-OSS 120B1,9
DeepSeek R1 670B1,7
Kimi K2.5 1T1,5
OpenAI : premiers résultats de Jalapeño OpenAI a comparé le maximum de jetons mixtes par seconde et par kilowatt avec des charges InferenceX nominales de 8 000 jetons en entrée et 1 000 en sortie, normalisées selon la puissance publiée des boîtiers.

Plus de travail. Moins d’attente.

L’inférence est la partie de l’IA que les utilisateurs ressentent. La latence détermine la rapidité du début et de la fin d’une réponse; le débit détermine combien de réponses le même budget énergétique peut servir.

Ces objectifs s’opposent souvent. Dans ces tests, OpenAI rapporte qu’une seule architecture a amélioré les deux. À l’échelle de ChatGPT, la conception de la puce peut alors devenir un avantage produit : des interactions plus rapides, une capacité accrue et moins d’énergie par unité de travail d’IA.

Un premier résultat, pas un verdict final

Les chiffres proviennent de charges InferenceX fixes avec une entrée nominale de 8 000 jetons, une sortie de 1 000 jetons et une prédiction à un seul jeton. OpenAI a fourni et publié les résultats du matériel avant déploiement; ils ne prouvent pas que Jalapeño devance tous les systèmes Nvidia, modèles, tailles de lot ou charges de production.

OpenAI affirme que le déploiement commencera d’ici la fin de 2026 pendant que la qualification et le travail logiciel se poursuivent. L’entreprise prévoit aussi continuer d’utiliser des accélérateurs commerciaux. Le signal utile est plus précis : une puce de première génération adaptée à la pile d’inférence d’un exploitant peut déjà rivaliser sur la vitesse et l’énergie.

Blackwell n’est pas soudainement obsolète. Mais l’inférence devient une compétition de bout en bout, et une puce maison peut maintenant façonner l’expérience visible, pas seulement la facture en coulisses.

Sources et limites

Les chiffres sont rapportés par OpenAI et propres aux charges testées. Ces sources présentent les données, la méthode et le contexte du déploiement.