La próxima carrera por la velocidad de la IA puede ganarse en la inferencia, no en el entrenamiento.
OpenAI afirma que Jalapeño, su primer chip de inferencia propio desarrollado junto con Broadcom, logró entre 1.5 y 1.9 veces el rendimiento máximo por kilovatio y entre 43% y 72% menos latencia de extremo a extremo que sistemas Nvidia GB200 y GB300 seleccionados en tres modelos abiertos.
Jalapeño produjo más por cada vatio
En tres pruebas con modelos abiertos, OpenAI reporta entre 1.5 y 1.9 veces el rendimiento máximo por kilovatio de los sistemas Nvidia comparados.
Son resultados publicados por OpenAI con hardware previo al despliegue y tres cargas fijas; no son una evaluación independiente en producción ni un resultado general para todos los sistemas Nvidia.
Ver los valores y el método
| Modelo | Rendimiento máximo por vatio |
|---|---|
| GPT-OSS 120B | 1.9 |
| DeepSeek R1 670B | 1.7 |
| Kimi K2.5 1T | 1.5 |
Más trabajo. Menos espera.
La inferencia es la parte de la IA que sienten los usuarios. La latencia define qué tan pronto empieza y termina una respuesta; el rendimiento determina cuántas respuestas puede servir el mismo presupuesto de energía.
Esos objetivos suelen competir. En estas pruebas, OpenAI reporta que una sola arquitectura mejoró ambos. A la escala de ChatGPT, eso puede convertir el diseño del chip en una ventaja de producto: interacciones más rápidas, más capacidad y menos energía por unidad de trabajo de IA.
Un primer resultado, no un veredicto final
Las cifras provienen de cargas fijas de InferenceX con 8,000 tokens de entrada, 1,000 de salida y predicción de un solo token nominales. OpenAI proporcionó y publicó los resultados del hardware previo al despliegue; no demuestran que Jalapeño lidere todos los sistemas Nvidia, modelos, tamaños de lote o cargas de producción.
OpenAI dice que el despliegue comenzará antes de terminar 2026 mientras continúan la calificación y el trabajo de software. También prevé seguir usando aceleradores comerciales. La señal útil es más concreta: un chip de primera generación ajustado a la plataforma de inferencia de un operador ya puede competir en velocidad y energía.
Blackwell no quedó obsoleto de repente. Pero la inferencia se está convirtiendo en una competencia de plataforma completa, y el silicio propio ya puede cambiar la experiencia que nota el usuario, no solo la factura que hay detrás.
Fuentes y límites
Las cifras fueron reportadas por OpenAI y corresponden a cargas específicas. Estas fuentes incluyen los datos, el método de prueba y el contexto del despliegue.
- OpenAI: primeros resultados de Jalapeño Tabla de pruebas, rendimiento y latencia sin procesar, normalización de potencia y limitaciones declaradas.
- OpenAI y Broadcom: anuncio de Jalapeño Arquitectura, alianza, despliegue previsto y función de los aceleradores comerciales.
- Metodología de InferenceX El formato de carga usado en las comparaciones publicadas con modelos abiertos.
