La prochaine course à la vitesse de l’IA pourrait se gagner à l’inférence, pas à l’entraînement.
OpenAI affirme que Jalapeño, sa première puce d’inférence maison codéveloppée avec Broadcom, a produit de 1,5 à 1,9 fois le débit maximal par kilowatt et de 43 % à 72 % moins de latence de bout en bout que certains systèmes Nvidia GB200 et GB300 sur trois modèles ouverts.
Jalapeño a produit davantage par watt
Dans trois tests de modèles ouverts, OpenAI rapporte de 1,5 à 1,9 fois le débit maximal par kilowatt des systèmes Nvidia comparés.
Il s’agit de résultats publiés par OpenAI sur du matériel avant déploiement et trois charges fixes, et non d’une évaluation indépendante en production ni d’un résultat général pour tous les systèmes Nvidia.
Voir les valeurs et la méthode
| Modèle | Débit maximal par watt |
|---|---|
| GPT-OSS 120B | 1,9 |
| DeepSeek R1 670B | 1,7 |
| Kimi K2.5 1T | 1,5 |
Plus de travail. Moins d’attente.
L’inférence est la partie de l’IA que les utilisateurs ressentent. La latence détermine la rapidité du début et de la fin d’une réponse; le débit détermine combien de réponses le même budget énergétique peut servir.
Ces objectifs s’opposent souvent. Dans ces tests, OpenAI rapporte qu’une seule architecture a amélioré les deux. À l’échelle de ChatGPT, la conception de la puce peut alors devenir un avantage produit : des interactions plus rapides, une capacité accrue et moins d’énergie par unité de travail d’IA.
Un premier résultat, pas un verdict final
Les chiffres proviennent de charges InferenceX fixes avec une entrée nominale de 8 000 jetons, une sortie de 1 000 jetons et une prédiction à un seul jeton. OpenAI a fourni et publié les résultats du matériel avant déploiement; ils ne prouvent pas que Jalapeño devance tous les systèmes Nvidia, modèles, tailles de lot ou charges de production.
OpenAI affirme que le déploiement commencera d’ici la fin de 2026 pendant que la qualification et le travail logiciel se poursuivent. L’entreprise prévoit aussi continuer d’utiliser des accélérateurs commerciaux. Le signal utile est plus précis : une puce de première génération adaptée à la pile d’inférence d’un exploitant peut déjà rivaliser sur la vitesse et l’énergie.
Blackwell n’est pas soudainement obsolète. Mais l’inférence devient une compétition de bout en bout, et une puce maison peut maintenant façonner l’expérience visible, pas seulement la facture en coulisses.
Sources et limites
Les chiffres sont rapportés par OpenAI et propres aux charges testées. Ces sources présentent les données, la méthode et le contexte du déploiement.
- OpenAI : premiers résultats de Jalapeño Tableau des tests, débit et latence bruts, normalisation de la puissance et limites déclarées.
- OpenAI et Broadcom : annonce de Jalapeño Architecture, partenariat, déploiement prévu et rôle des accélérateurs commerciaux.
- Méthodologie InferenceX Le format de charge utilisé pour les comparaisons publiées de modèles ouverts.
