Saltar al contenido principal

OpenAI mide su chip Jalapeño contra los racks de NVIDIA

OpenAI publicó los primeros resultados de Jalapeño: más throughput y menos latencia a la vez, con 40 a 60% menos consumo. Son sus propias mediciones.

OpenAI mide su chip Jalapeño contra los racks de NVIDIA

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

Estrategia Empresarial 4 min de lectura

OpenAI publicó las primeras mediciones de Jalapeño, el chip de inferencia que diseñó con Broadcom, y los números son grandes.

Entre 1,5 y 1,9 veces más throughput que los racks GB200 y GB300 de NVIDIA. Latencia de punta a punta entre 1,7 y 3,6 veces menor en GPT-OSS-120B, DeepSeek R1 y Kimi K2.5. Consumo estimado entre 40 y 60% más bajo.

Antes de seguir, la etiqueta. Las cifras las entregó OpenAI. SemiAnalysis presenció las corridas de InferenceX en el laboratorio y confirmó que las evaluaciones GSM8k quedaron a la par de NVIDIA, pero no corrió la suite completa ni vio los resultados de AgentX. El chip todavía no está disponible, y el fabricante siempre publica el escenario donde gana.

Con esa etiqueta pegada, igual vale mirarlo.

El precio por token que pagas tiene un piso de hardware

Cuando negocias un contrato de API o comparas proveedores de modelos, estás mirando la punta de una cadena. Abajo de ese precio hay un costo real de correr un modelo, y ese costo lo determina el hardware.

Durante tres años ese hardware fue de propósito general. Las mismas piezas que entrenan modelos son las que los ejecutan, y eso deja capacidad instalada que la inferencia no aprovecha.

Jalapeño es solo inferencia. No entrena nada. Richard Ho, VP de hardware de OpenAI, lo resumió diciendo que lo diseñaron para minimizar el movimiento de datos y las demoras de comunicación.

Especializarse en una sola cosa suele salir mejor que servir dos. Es la historia del hardware desde siempre.

Nueve meses del diseño al tape-out

Ese dato me parece más interesante que los benchmarks.

Un chip de este tamaño solía tomar de dos a tres años. OpenAI reporta nueve meses del diseño al tape-out, con ayuda de sus propios modelos en el proceso de diseño.

Si eso se sostiene, el ciclo de renovación de hardware para IA se acorta a la mitad, y la ventaja de quien tiene la mejor pieza hoy dura mucho menos de lo que dura una decisión de infraestructura empresarial. Firmas un contrato a tres años sobre una realidad de costos que va a cambiar dos veces en ese plazo.

Lo que esto te obliga a revisar

Nada de esto implica que compres hardware. Implica otra cosa, y es más barata.

Tu empresa tiene una lista de casos de uso descartados. Están en un correo de 2025 o en una diapositiva, y la razón que dice al lado es alguna versión de “sale muy caro por consulta”.

Esa lista se armó con un costo por token que ya cambió, y va a volver a cambiar cuando esta clase de silicio entre en volumen en 2027.

Escribimos sobre esta trampa en el precio por token miente y sobre el caso concreto en las diez pruebas matemáticas de Astra y el costo de inferencia. La conclusión práctica es la misma: un caso de uso descartado por costo no está muerto, está pausado, y merece una revisión con calendario.

Qué haría en concreto

Busca esa lista. Si no existe, ese es el primer trabajo: escribir los casos que alguien propuso y se descartaron, con la razón al lado.

Marca cuáles se cayeron por costo y cuáles por otra cosa. Los que se cayeron porque el proceso no estaba claro o porque nadie era dueño del resultado no los arregla ningún chip.

Ponle fecha a los de costo. Cada seis meses, recalcula con los precios del momento. Toma media hora y es la revisión con mejor retorno que conozco, porque el trabajo pesado, entender el proceso, ya lo hiciste.

Jalapeño llega en volumen en 2027. Tu lista se puede revisar el martes.

Recalcula un caso que descartaste por costo

Preguntas Frecuentes

OpenAI Broadcom Jalapeño costo de inferencia NVIDIA infraestructura de IA estrategia B2B

Artículos Relacionados

OpenAI Astra: diez problemas abiertos por $2,000 en tokens
Estrategia Empresarial
· 8 min de lectura

OpenAI Astra: diez problemas abiertos por $2,000 en tokens

OpenAI dice que una versión interna de Astra resolvió diez problemas abiertos, con certificados en Lean 4. Los tokens costarían unos $2,000 a tarifas de Sol.

OpenAI Astra Lean 4
NVIDIA garantiza 105.000 millones del arriendo de OpenAI
Estrategia Empresarial
· 8 min de lectura

NVIDIA garantiza 105.000 millones del arriendo de OpenAI

NVIDIA respalda hasta 105.000 millones del arriendo de OpenAI en Ohio. La garantía solo paga si OpenAI quiebra, y se apaga si mejora su crédito.

NVIDIA OpenAI financiamiento circular
Nexus le ganó a GPT-5.5 por un punto y costó 77% menos
IA y Automatización
· 5 min de lectura

Nexus le ganó a GPT-5.5 por un punto y costó 77% menos

La prensa dijo que Pinecone Nexus superó a los modelos frontera. El dato primario dice 47,4% contra 46,4%. Lo que compró la capa de conocimiento fue costo.

Pinecone Nexus Sierra
Perplexity a 30.000 millones con 750 de facturación
Estrategia Empresarial
· 4 min de lectura

Perplexity a 30.000 millones con 750 de facturación

The Information reportó que NVIDIA negocia entrar a Perplexity. El múltiplo es de 40 veces ingresos, y en enero comprometió a Azure su facturación entera.

Perplexity NVIDIA motores de respuesta
OpenAI le corta los modelos a Cursor por ser de Musk
Estrategia Empresarial
· 4 min de lectura

OpenAI le corta los modelos a Cursor por ser de Musk

OpenAI termina el contrato con Cursor el 12 de noviembre tras la compra de SpaceX. La cláusula de cambio de control estaba firmada desde antes y decidió todo.

OpenAI Cursor SpaceX