Jalapeño: el chip de OpenAI que supera a Nvidia en inferencia

OpenAI ha dado a conocer los primeros resultados de su chip de inferencia llamado Jalapeño, desarrollado junto a Broadcom. Las pruebas, realizadas por un benchmark independiente llamado InferenceX de SemiAnalysis, muestran que este chip es más rápido y eficiente que los sistemas actuales de Nvidia, como Blackwell. Esto podría cambiar las reglas del juego en el mundo de la inteligencia artificial.

Qué es Jalapeño y por qué importa

Jalapeño es un chip diseñado específicamente para la inferencia, es decir, para ejecutar modelos de IA ya entrenados y generar respuestas. No está pensado para entrenar modelos, sino para servirlos de manera rápida y económica. OpenAI lo ha creado con la ayuda de Broadcom, una empresa con experiencia en diseñar chips a medida para otros. El anuncio se hizo en octubre de 2025 y ahora, en junio de 2026, ya hay resultados públicos.

La noticia es relevante porque, por primera vez, un chip hecho por un laboratorio de IA para sus propios modelos supera a Nvidia en su terreno, medido por un tercero. Nvidia ha sido el estándar de facto para servir modelos grandes, pero este nuevo chip podría cambiar esa dinámica.

Qué mide el benchmark InferenceX

Los benchmarks de chips de IA suelen ser poco fiables, porque cada fabricante elige la métrica que le favorece. InferenceX intenta ser más objetivo midiendo dos cosas que importan de verdad:

  • Tokens por usuario: cuánto texto genera el sistema para una persona que espera una respuesta. Es la métrica de latencia percibida.
  • Throughput por kilovatio: cuánto trabajo total sale del sistema por cada unidad de electricidad consumida. Es la métrica de coste, porque en un centro de datos la electricidad pesa más que el hardware.

Jalapeño gana en ambas métricas. Eso significa que no es un chip que corre rápido a base de consumir más energía, sino que es eficiente de verdad.

De dónde sale la ventaja

La clave está en mover menos datos. Jalapeño está diseñado para minimizar el movimiento de datos y los retrasos de comunicación entre componentes. Optimiza la fase de prefill, que es cuando el modelo procesa el prompt de entrada antes de empezar a escribir la respuesta, y gestiona la KV cache en local, en lugar de ir a buscarla fuera.

La KV cache es la memoria de trabajo del modelo en una conversación: guarda lo que ya ha procesado para no recalcularlo en cada token nuevo. Si esa cache está lejos del chip, el sistema pierde tiempo esperando datos. Con contextos largos, que son habituales hoy, ese tiempo de espera consume mucha energía.

Nvidia diseña chips que sirven para entrenar e inferir, para varios tipos de modelos y para muchos clientes. OpenAI, en cambio, diseña un chip para servir sus propios modelos con su patrón de uso. Es un chip peor en general, pero mejor en su caso concreto.

Qué significa para las empresas

La lectura obvia es que OpenAI quiere depender menos de Nvidia. Pero la lectura más útil es la del coste por token. El precio de los modelos de IA no baja porque los laboratorios sean generosos, sino porque el coste de servirlos baja. OpenAI ya recortó precios de GPT-5.6 hace unos días, y su responsable de producto dice que es una corrección permanente, no una promoción. Un chip propio que rinde más por kilovatio es una de las palancas que hacen que esa corrección sea sostenible.

Para las empresas que usan la API de OpenAI, esto se traduce en una regla práctica: los cálculos de rentabilidad de procesos automatizados que hiciste hace seis meses probablemente ya están desactualizados, y lo están a tu favor. Procesos que descartaste por caros, como revisar todos los pedidos o clasificar todos los tickets, merecen que vuelvas a hacer los números.

Quién más está en esta partida

Jalapeño no aparece en el vacío. Los grandes compradores de GPUs llevan años intentando dejar de depender de Nvidia:

  • Google: lleva desde 2016 con sus TPU y entrena y sirve Gemini casi entero con silicio propio.
  • Amazon: tiene Trainium para entrenamiento e Inferentia para inferencia, y es la infraestructura que usa Anthropic.
  • Meta: tiene MTIA, centrado en los modelos de recomendación que mueven su publicidad.

Lo que hace distinto a OpenAI es la vía: en lugar de montar un equipo de silicio desde cero, se ha apoyado en Broadcom, que lleva décadas diseñando chips a medida. Eso explica que en apenas diez meses haya números públicos.

Resultados concretos

Según las pruebas de OpenAI, Jalapeño superó a los sistemas Nvidia GB200 y GB300 en los tres modelos probados: GPT-OSS 120B, DeepSeek R1 y Kimi K2.5 1T. Los resultados son:

Métrica Mejora de Jalapeño
Trabajo por vatio 1,5 a 1,9 veces más
Tiempo de respuesta 1,7 a 3,6 veces más rápido

El chip funciona a unos 700 vatios, frente a los 1.200 vatios del sistema Nvidia Blackwell. Eso reduce el coste de alimentar los centros de datos.

Lo que todavía no sabemos

OpenAI habla de volúmenes muy pequeños a finales de 2026 y de despliegue serio en 2027. Entre un benchmark bueno y un centro de datos lleno de estos chips hay dieciocho meses de fabricación, validación y software.

Además, hay una parte que nadie enseña en estos anuncios: el software. Una GPU de Nvidia viene con CUDA, veinte años de librerías y una comunidad enorme que ya ha resuelto los problemas raros. Un chip nuevo llega con un compilador propio y con la mitad de los casos límite por descubrir. Ese trabajo no sale en los benchmarks y se paga en meses de ingeniería.

Tampoco hay cifras absolutas públicas: sabemos que gana a Blackwell en esas dos métricas, pero no por cuánto. Y Nvidia no se queda quieta: la plataforma Vera Rubin, que SpaceXAI acaba de adoptar, es exactamente la respuesta a este tipo de presión.

OpenAI ya está trabajando en una segunda generación del chip y planea una tercera. Aun así, seguirá necesitando a Nvidia para una gran parte de su infraestructura.

Preguntas y respuestas

¿Qué es el chip Jalapeño?

Es un chip de inferencia diseñado por OpenAI junto a Broadcom, optimizado para servir modelos de IA de forma rápida y eficiente, en lugar de entrenarlos.

¿Cuánto más rápido es que Nvidia?

Según las pruebas, Jalapeño responde entre 1,7 y 3,6 veces más rápido que los sistemas Nvidia Blackwell, y realiza entre 1,5 y 1,9 veces más trabajo por vatio.

¿Cuándo estará disponible?

OpenAI planea empezar a desplegarlo en su infraestructura a finales de 2026, con volúmenes pequeños, y aumentar la producción en 2027.

¿Significa que OpenAI dejará de usar Nvidia?

No. OpenAI seguirá necesitando una gran cantidad de chips de Nvidia, pero Jalapeño le permitirá reducir costes y mejorar el rendimiento en tareas de inferencia.