OpenAI construyó su propio chip de IA. Esto es lo que significa para tu cartera y tus tiempos de espera.
El silicio personalizado de OpenAI, llamado Jalapeño, promete respuestas más rápidas y facturas de energía más bajas. Los volúmenes pequeños se enviarán antes de finales de 2025, con un impulso mayor en 2027.

Puntos clave
- El chip Jalapeño de OpenAI, creado con Broadcom, entrega de 1,5 a 1,9 veces más trabajo de IA por unidad de electricidad que los superchips comparables de Nvidia en pruebas de rendimiento.
- El chip reduce el tiempo de respuesta de extremo a extremo de 1,7 a 3,6 veces en tres modelos de IA grandes probados.
- OpenAI enviará Jalapeño en cantidades pequeñas antes de finales de 2025, escalando hasta 2027.
- Nvidia sigue siendo parte del plan de hardware de OpenAI; Jalapeño no lo reemplaza.
OpenAI tiene un chip nuevo, y no proviene de Nvidia.
La empresa publicó una entrada de blog el martes describiendo Jalapeño, un procesador personalizado creado con Broadcom. Richard Ho, vicepresidente de hardware de OpenAI, explicó los números a reporteros en una conferencia de prensa, con The Verge AI siendo el primero en reportar los detalles.
¿Qué es Jalapeño y por qué debería importarte?
Jalapeño es un ASIC, sigla de circuito integrado específico de aplicación: un chip diseñado para hacer una tarea extremadamente bien en lugar de una amplia gama de tareas. Esa tarea es la inferencia de IA, el proceso de ejecutar un modelo de IA terminado lo suficientemente rápido para responder una consulta o potenciar un agente de IA, es decir, software que realiza tareas de múltiples pasos de forma independiente.
Cada mensaje que envías a ChatGPT desencadena una inferencia. La inferencia más rápida y económica significa esperas más cortas y, con el tiempo, costos más bajos para que OpenAI te sirva. Hemos estado siguiendo esta esquina de la carrera de hardware desde agosto, incluido el trabajo de latencia propio de Nvidia y una apuesta solo de software de la startup francesa Kog: el movimiento de OpenAI es la primera vez que un proveedor de modelos importante publica datos de rendimiento para su propio silicio.
¿Cuán grande es la brecha de rendimiento?
OpenAI probó Jalapeño en InferenceX, una plataforma de evaluación pública que califica qué tan eficientemente los chips ejecutan modelos de IA. La comparación fue contra los superchips GB200 y GB300 de Nvidia.
| Métrica | Jalapeño vs. Nvidia GB200/GB300 |
|---|---|
| Trabajo de IA por vatio (GPT-OSS 120B) | 1,5x a 1,9x mejor |
| Trabajo de IA por vatio (DeepSeek R1) | 1,5x a 1,9x mejor |
| Trabajo de IA por vatio (Kimi K2.5 1T) | 1,5x a 1,9x mejor |
| Tiempo de respuesta de extremo a extremo | 1,7x a 3,6x más rápido |
Ho dijo que Jalapeño rompe una compensación común: el hardware de IA generalmente obliga a los ingenieros a elegir entre velocidad y rendimiento, el volumen de solicitudes manejadas a la vez. OpenAI afirma que su chip es fuerte en ambos aspectos.
¿Qué significa esto para las personas que usan los productos de OpenAI?
La inferencia más rápida es el beneficio directo. Si las afirmaciones se mantienen a escala, las respuestas de ChatGPT llegarán más rápido y los agentes de IA se sentirán más reactivos.
Más barato de ejecutar no significa automáticamente más barato para los suscriptores. Sí significa que OpenAI puede manejar más usuarios sin facturas de electricidad proporcionalmente más altas, lo cual importa a medida que la demanda aumenta.
Estos números provienen de la propia conferencia de prensa de OpenAI, basados en evaluaciones controladas. El desempeño en el mundo real en millones de solicitudes variadas es algo diferente. Los chips se enviarán en volúmenes pequeños a finales de 2025 y se escalarán en 2027, por lo que la mayoría de los usuarios no sentirán ningún cambio por un tiempo.
OpenAI también dejó claro que Nvidia no desaparecerá. Ho describió a Nvidia como uno de varios "muy buenos socios" en la estrategia general de computación de la empresa.
Conclusión honesta: La verdadera prueba del chip no es una presentación de números; es 2026, cuando el lanzamiento alcance una escala significativa y comiencen a llegar resultados independientes. Hasta entonces, el número titular en el que debes enfocarte es la mejora de latencia de 3,6x: si incluso la mitad de ella sobrevive el contacto con el tráfico de producción, la espera mejorará notablemente.



