La próxima carrera por la velocidad de la IA puede ganarse en la inferencia, no en el entrenamiento.

OpenAI afirma que Jalapeño, su primer chip de inferencia propio desarrollado junto con Broadcom, logró entre 1.5 y 1.9 veces el rendimiento máximo por kilovatio y entre 43% y 72% menos latencia de extremo a extremo que sistemas Nvidia GB200 y GB300 seleccionados en tres modelos abiertos.

Jalapeño produjo más por cada vatio

En tres pruebas con modelos abiertos, OpenAI reporta entre 1.5 y 1.9 veces el rendimiento máximo por kilovatio de los sistemas Nvidia comparados.

Son resultados publicados por OpenAI con hardware previo al despliegue y tres cargas fijas; no son una evaluación independiente en producción ni un resultado general para todos los sistemas Nvidia.

Ver los valores y el método
Jalapeño produjo más por cada vatio
ModeloRendimiento máximo por vatio
GPT-OSS 120B1.9
DeepSeek R1 670B1.7
Kimi K2.5 1T1.5
OpenAI: primeros resultados de Jalapeño OpenAI comparó el máximo de tokens mixtos por segundo y kilovatio en cargas de InferenceX con 8K tokens de entrada y 1K de salida nominales, normalizadas con la potencia publicada de cada paquete.

Más trabajo. Menos espera.

La inferencia es la parte de la IA que sienten los usuarios. La latencia define qué tan pronto empieza y termina una respuesta; el rendimiento determina cuántas respuestas puede servir el mismo presupuesto de energía.

Esos objetivos suelen competir. En estas pruebas, OpenAI reporta que una sola arquitectura mejoró ambos. A la escala de ChatGPT, eso puede convertir el diseño del chip en una ventaja de producto: interacciones más rápidas, más capacidad y menos energía por unidad de trabajo de IA.

Un primer resultado, no un veredicto final

Las cifras provienen de cargas fijas de InferenceX con 8,000 tokens de entrada, 1,000 de salida y predicción de un solo token nominales. OpenAI proporcionó y publicó los resultados del hardware previo al despliegue; no demuestran que Jalapeño lidere todos los sistemas Nvidia, modelos, tamaños de lote o cargas de producción.

OpenAI dice que el despliegue comenzará antes de terminar 2026 mientras continúan la calificación y el trabajo de software. También prevé seguir usando aceleradores comerciales. La señal útil es más concreta: un chip de primera generación ajustado a la plataforma de inferencia de un operador ya puede competir en velocidad y energía.

Blackwell no quedó obsoleto de repente. Pero la inferencia se está convirtiendo en una competencia de plataforma completa, y el silicio propio ya puede cambiar la experiencia que nota el usuario, no solo la factura que hay detrás.

Fuentes y límites

Las cifras fueron reportadas por OpenAI y corresponden a cargas específicas. Estas fuentes incluyen los datos, el método de prueba y el contexto del despliegue.