OpenAI mide su chip Jalapeño contra los racks de NVIDIA
Ricardo Argüello, 6 de septiembre de 2026
CEO & Fundador
Resumen general
El 25 de agosto de 2026 salieron los primeros resultados de Jalapeño, el chip de inferencia que OpenAI diseñó con Broadcom. Según las mediciones de OpenAI, entrega entre 1,5 y 1,9 veces más throughput que los racks GB200 y GB300 de NVIDIA, con latencia de punta a punta entre 1,7 y 3,6 veces menor, y un consumo estimado entre 40 y 60% más bajo. La disponibilidad inicial es a finales de 2026 y el volumen llega en 2027.
- Jalapeño es un chip de inferencia solamente, diseñado por OpenAI e implementado por Broadcom, del diseño al tape-out en nueve meses
- Un sistema lleva 128 aceleradores, 1,7 exaFLOPS de cómputo de 4 bits y 27,5 TB de memoria HBM4
- OpenAI reporta entre 1,5 y 1,9 veces más throughput que los racks GB200 y GB300 de NVIDIA
- Reporta latencia de punta a punta entre 1,7 y 3,6 veces menor en GPT-OSS-120B, DeepSeek R1 y Kimi K2.5
- Las cifras las entregó OpenAI y SemiAnalysis solo presenció las corridas; la disponibilidad inicial es a finales de 2026 y el volumen en 2027
Imagina que llevas años pagando el flete de tus productos con la única flota de camiones que existe, y ese precio entró como número fijo en tu lista de precios. Un competidor del transportista aparece con camiones que llevan el doble de carga y gastan la mitad de combustible. No te cambia el producto. Te cambia cuáles envíos tenían sentido y cuáles descartaste por caros. Eso es lo que un chip de inferencia más eficiente le hace a tu lista de proyectos de IA.
Resumen generado con IA
OpenAI publicó las primeras mediciones de Jalapeño, el chip de inferencia que diseñó con Broadcom, y los números son grandes.
Entre 1,5 y 1,9 veces más throughput que los racks GB200 y GB300 de NVIDIA. Latencia de punta a punta entre 1,7 y 3,6 veces menor en GPT-OSS-120B, DeepSeek R1 y Kimi K2.5. Consumo estimado entre 40 y 60% más bajo.
Antes de seguir, la etiqueta. Las cifras las entregó OpenAI. SemiAnalysis presenció las corridas de InferenceX en el laboratorio y confirmó que las evaluaciones GSM8k quedaron a la par de NVIDIA, pero no corrió la suite completa ni vio los resultados de AgentX. El chip todavía no está disponible, y el fabricante siempre publica el escenario donde gana.
Con esa etiqueta pegada, igual vale mirarlo.
El precio por token que pagas tiene un piso de hardware
Cuando negocias un contrato de API o comparas proveedores de modelos, estás mirando la punta de una cadena. Abajo de ese precio hay un costo real de correr un modelo, y ese costo lo determina el hardware.
Durante tres años ese hardware fue de propósito general. Las mismas piezas que entrenan modelos son las que los ejecutan, y eso deja capacidad instalada que la inferencia no aprovecha.
Jalapeño es solo inferencia. No entrena nada. Richard Ho, VP de hardware de OpenAI, lo resumió diciendo que lo diseñaron para minimizar el movimiento de datos y las demoras de comunicación.
Especializarse en una sola cosa suele salir mejor que servir dos. Es la historia del hardware desde siempre.
Nueve meses del diseño al tape-out
Ese dato me parece más interesante que los benchmarks.
Un chip de este tamaño solía tomar de dos a tres años. OpenAI reporta nueve meses del diseño al tape-out, con ayuda de sus propios modelos en el proceso de diseño.
Si eso se sostiene, el ciclo de renovación de hardware para IA se acorta a la mitad, y la ventaja de quien tiene la mejor pieza hoy dura mucho menos de lo que dura una decisión de infraestructura empresarial. Firmas un contrato a tres años sobre una realidad de costos que va a cambiar dos veces en ese plazo.
Lo que esto te obliga a revisar
Nada de esto implica que compres hardware. Implica otra cosa, y es más barata.
Tu empresa tiene una lista de casos de uso descartados. Están en un correo de 2025 o en una diapositiva, y la razón que dice al lado es alguna versión de “sale muy caro por consulta”.
Esa lista se armó con un costo por token que ya cambió, y va a volver a cambiar cuando esta clase de silicio entre en volumen en 2027.
Escribimos sobre esta trampa en el precio por token miente y sobre el caso concreto en las diez pruebas matemáticas de Astra y el costo de inferencia. La conclusión práctica es la misma: un caso de uso descartado por costo no está muerto, está pausado, y merece una revisión con calendario.
Qué haría en concreto
Busca esa lista. Si no existe, ese es el primer trabajo: escribir los casos que alguien propuso y se descartaron, con la razón al lado.
Marca cuáles se cayeron por costo y cuáles por otra cosa. Los que se cayeron porque el proceso no estaba claro o porque nadie era dueño del resultado no los arregla ningún chip.
Ponle fecha a los de costo. Cada seis meses, recalcula con los precios del momento. Toma media hora y es la revisión con mejor retorno que conozco, porque el trabajo pesado, entender el proceso, ya lo hiciste.
Jalapeño llega en volumen en 2027. Tu lista se puede revisar el martes.
Recalcula un caso que descartaste por costoPreguntas Frecuentes
Es el primer chip propio de OpenAI, diseñado con Broadcom y dedicado exclusivamente a inferencia, o sea a correr modelos ya entrenados. Fue presentado en junio de 2026 y sus primeros resultados se publicaron el 25 de agosto. La disponibilidad inicial es a finales de 2026 y la producción en volumen llega en 2027.
OpenAI reporta entre 1,5 y 1,9 veces más throughput que los racks GB200 NVL72 y GB300 NVL72 de NVIDIA, latencia de punta a punta entre 1,7 y 3,6 veces menor en modelos como GPT-OSS-120B, DeepSeek R1 y Kimi K2.5, y un consumo estimado entre 40 y 60% más bajo. Las cifras las entregó OpenAI. SemiAnalysis presenció las corridas de InferenceX en el laboratorio y confirmó que las evaluaciones GSM8k quedaron a la par de los chips de NVIDIA, pero no corrió la suite completa ni vio los resultados de AgentX.
Porque el precio por token que pagas hoy refleja el costo de correr esos modelos en hardware de propósito general. Cuando el hardware se especializa, cambia el piso de ese precio y con él la lista de casos de uso que eran demasiado caros por llamada. Los proyectos que descartaste por costo merecen una revisión anual.
El entrenamiento crea el modelo y necesita mucha memoria y cómputo sostenido durante semanas. La inferencia lo ejecuta para responder consultas y premia la latencia baja y la eficiencia energética por respuesta. Jalapeño está diseñado solo para inferencia, a diferencia de las piezas de NVIDIA y AMD que atienden ambos casos.
Artículos Relacionados
OpenAI Astra: diez problemas abiertos por $2,000 en tokens
OpenAI dice que una versión interna de Astra resolvió diez problemas abiertos, con certificados en Lean 4. Los tokens costarían unos $2,000 a tarifas de Sol.
NVIDIA garantiza 105.000 millones del arriendo de OpenAI
NVIDIA respalda hasta 105.000 millones del arriendo de OpenAI en Ohio. La garantía solo paga si OpenAI quiebra, y se apaga si mejora su crédito.
Nexus le ganó a GPT-5.5 por un punto y costó 77% menos
La prensa dijo que Pinecone Nexus superó a los modelos frontera. El dato primario dice 47,4% contra 46,4%. Lo que compró la capa de conocimiento fue costo.
Perplexity a 30.000 millones con 750 de facturación
The Information reportó que NVIDIA negocia entrar a Perplexity. El múltiplo es de 40 veces ingresos, y en enero comprometió a Azure su facturación entera.
Bristol Myers Squibb construye su propia fábrica de IA, no la renta
BMS es la tercera farmacéutica en nueve meses en construir su supercómputo de IA con NVIDIA. La capa que renta no es la misma que la que construye.
OpenAI le corta los modelos a Cursor por ser de Musk
OpenAI termina el contrato con Cursor el 12 de noviembre tras la compra de SpaceX. La cláusula de cambio de control estaba firmada desde antes y decidió todo.