OpenAI presentó Jalapeño: su chip para inferencia acelera las respuestas de los modelos casi cuatro veces

19 septiembre 202617 vistas

Desarrollado junto con Broadcom, el procesador Jalapeño promete un aumento notable del rendimiento por vatio y menores latencias al trabajar con grandes modelos de lenguaje: en escenarios interactivos se anuncia una mejora de hasta 4,1 veces. El despliegue en la infraestructura de OpenAI está previsto para finales de año, aunque la compañía se niega a descartar los aceleradores de Nvidia.

OpenAI presentó Jalapeño: su chip para inferencia acelera las respuestas de los modelos casi cuatro veces

Qué mostró OpenAI el 25 de agosto

OpenAI presentó los resultados de las pruebas de su propio procesador de IA: Jalapeño. No se trata de un desarrollo externo por encargo, sino del primer chip llevado hasta la etapa de benchmarks medibles: el proyecto se llevó a cabo junto con Broadcom y el informe público apareció el 25 de agosto de 2026.

Sam Altman comentó la noticia en X con una sola frase: «we made a chip and it is fast». Breve, pero al grano: el énfasis principal no está puesto en la flexibilidad o la versatilidad, sino en la pura velocidad de respuesta.

El detalle clave es el propósito. El chip está diseñado para la inferencia de grandes modelos de lenguaje, es decir, para atender modelos ya listos en el momento en que el usuario formula una pregunta. Las cargas generales de IA, el entrenamiento y la experimentación con arquitecturas quedan en otra tecnología. OpenAI planea desplegar Jalapeño en su propia infraestructura de cómputo para finales de 2026.

Por qué el foco está precisamente en la inferencia

La diferencia entre entrenar un modelo y hacerlo funcionar en producción es la diferencia entre construir un edificio y operarlo. Cuando el modelo ya está ensamblado, los costos y las latencias se trasladan a otro lugar: qué tan rápido llegan los datos del modelo a los bloques de cómputo, cuántas veces hay que moverlos y cuánto tiempo se pierde en el intercambio entre la memoria y los componentes de red.

Los desarrolladores de Jalapeño abordaron precisamente este problema: la descoordinación entre cómputo, memoria y red. La idea es mantener los parámetros del modelo y los datos del KV cache lo más cerca posible de donde ocurre el procesamiento activo. Cuantos menos movimientos de información haya entre los niveles del sistema, más corto será el camino desde la consulta hasta el primer token y más uniforme la respuesta en generaciones largas. En la empresa lo describen como una coordinación más densa de las tres capas —cómputo, memoria y red— en lugar de su optimización independiente.

El segundo efecto declarado es más trabajo útil de IA por cada vatio de energía en carga máxima. Para los centros de datos esto no es una métrica abstracta: la electricidad y la refrigeración hace tiempo que se convirtieron en un limitante para escalar.

Cómo y con qué se probó

Modelos y benchmark

Las pruebas se realizaron con tres modelos de distinta escala: GPT OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T. Las mediciones se hicieron a través de InferenceX, un benchmark público preparado por SemiAnalysis. La comparación se hizo con sistemas comerciales de IA, es decir, no contra una referencia abstracta, sino contra soluciones que funcionan en el mercado.

Qué arrojaron los números

  • en el pico de rendimiento — entre 1,5 y 1,9 veces más trabajo de IA por vatio;
  • la latencia de extremo a extremo se redujo entre 1,7 y 3,6 veces;
  • en escenarios interactivos se registró un aumento de rendimiento de 2,1 a 4,1 veces — de ahí surgió la formulación «casi cuatro veces más rápido».

Dónde se nota más la ganancia

La dispersión en las cifras no es un margen de error, sino una señal importante. La diferencia entre el límite inferior y el superior depende del tipo de carga. Donde el sistema trabaja por lotes y está saturado, la ganancia es más modesta. Donde las consultas llegan de a una y el usuario espera la respuesta en tiempo real, la ventaja se vuelve máxima.

De ahí también el interés particular por los agentes. Cuando un sistema de IA realiza una tarea en varios pasos —planifica, recurre a herramientas, obtiene datos, genera una respuesta— las latencias se acumulan. Cada paso adicional añade espera, y en una cadena larga la diferencia entre «un segundo y medio» y «medio segundo» se convierte en una experiencia de usuario completamente distinta. La reducción de la latencia en escenarios interactivos ataca directamente este problema.

En OpenAI esperan que estos indicadores respalden productos más rápidos y mejoren la economía de la infraestructura: sale más barato atender el mismo volumen de consultas.

Chips propios, pero no en lugar de Nvidia

Aquí es importante no confundir la señal. La empresa no piensa deshacerse de los aceleradores de Nvidia: siguen en el circuito tanto para el entrenamiento como para la inferencia. Jalapeño se posiciona como una capa de cómputo adicional para un tipo concreto de tareas, no como un reemplazo inmediato del hardware existente.

Un detalle curioso del relato de la propia empresa: el ciclo de desarrollo se logró reducir a nueve meses, y los propios modelos de OpenAI desempeñaron un papel notable en ello. Es decir, la IA ayudó a diseñar el chip sobre el que después funcionará la IA.

Qué viene después

La Gen 2 ya está en desarrollo. Esto indica que no se trata de un experimento puntual, sino de una apuesta a largo plazo por el silicio propio como parte de la futura infraestructura de IA.

Conviene tener presente una salvedad: todas las cifras mencionadas son resultados declarados en un benchmark público concreto, no una verificación independiente en manos de terceros. Mucho quedará más claro cuando el chip realmente se despliegue en la infraestructura a finales de 2026 y aparezcan datos de cargas reales de producción, y no de pruebas de laboratorio. Por ahora, la conclusión principal es simple: la carrera por la velocidad de respuesta de los modelos se trasladó del nivel del software al nivel del hardware.

Preguntas frecuentes

Material similar

Todos los materiales
OpenAI presentó Jalapeño: su chip para inferencia acelera las respuestas de los modelos casi cuatro veces