OpenAI acaba de ponerle precio a la latencia: la Ultrafast API te cobra 6x por ir más rápido y las microdecisiones salen a $0,10 por millón de tokens. Si tu agente no distingue entre una ruta interactiva y un batch, estás quemando margen sin darte cuenta.
Durante dos años la velocidad fue un detalle de infraestructura: tú optimizabas prompts, metías streaming y rezabas para que el primer token llegara antes de que el usuario cerrara la pestaña. Se acabó. Con el tier Ultrafast para GPT-6.1 Sol y la apertura pública del Decisions API, OpenAI convirtió la latencia en una línea facturable con precio explícito.
Mi postura, corta: esto no es una mejora de producto, es una segmentación de mercado por velocidad. Y como todo lo que segmenta por velocidad, va a castigar a quien no clasifique sus llamadas. El que trate todas las requests igual va a pagar premium por trabajo que no lo necesita.
Qué pasó
OpenAI abrió a beta pública su Decisions API: $0,10 por millón de tokens de entrada, sin cargo por tokens de salida y sin costo por lecturas o escrituras de caché. Es un producto diseñado para microdecisiones dentro del bucle agéntico, no para generar texto largo.
En paralelo activó el tier Ultrafast para GPT-6.1 Sol, el modelo que presentó en su DevDay del 29 de septiembre de 2026. Ultrafast cobra $12 por millón de tokens de entrada y $60 por millón de salida: exactamente 6x las tarifas estándar del modelo ($2/$10). A cambio, OpenAI promete hasta 8x más velocidad de generación en Codex y hasta 6x en la API.
El ejemplo de factura que circula lo deja claro: una petición de 100.000 tokens de entrada sin caché más 10.000 de salida cuesta ~$0,30 en Standard, ~$0,60 en Fast y ~$1,80 en Ultrafast. Tres veces el precio de Standard por la misma tarea, solo por cambiar el tier de servicio. Y ojo con el detalle: GPT-6.1 Sol se lanzó el 29 de septiembre; Ultrafast no es un modelo nuevo, es una capa de servicio sobre el mismo modelo.
Qué significa
Primero, el número que todos repiten: 10x. No lo compres sin filtro. El techo declarado por OpenAI es 8x en Codex y 6x en la API, y no publica tokens por segundo ni latencia garantizada de primer token para Sol Ultrafast. Un análisis independiente en video midió apenas 4,4x de mejora real. Cuando el proveedor no publica la métrica que importa, la promesa es marketing, no SLA.
Segundo, el precio del Decisions API suena barato hasta que lo comparas. Microsoft-Decision-1 se ofrece a $0,042 por millón de entrada con salida gratis y 85 ms de latencia p50. Anthropic juega con Claude Haiku 5.5 desde $0,10/$0,50. O sea: OpenAI no llegó a esta categoría a romper el mercado, llegó a defender terreno. El precio de $0,10 es más caro que el de Microsoft con salida gratis incluida.
Tercero, y esto es lo que de verdad importa para tu P&L: el input cacheado de Ultrafast cuesta $0,60 por millón, un 95% menos que su tarifa normal de entrada de $12. Si tu agente arrastra prompts de sistema largos y estables, el caché es la diferencia entre amortizar el premium de velocidad o pagarlo completo. La escritura de caché cuesta $15, así que el cálculo solo cierra si reutilizas ese contexto muchas veces.
Cuarto, el modelo de negocio es transparente: OpenAI está replicando el patrón de tiers Standard/Fast/Batch/Flex que ya usa toda la industria. La inteligencia dejó de ser el único eje de segmentación; ahora la velocidad es un producto propio. Y cuando la velocidad es producto, la arquitectura de tu agente se vuelve una decisión financiera, no técnica.
Qué hacer al respecto
Clasifica cada llamada de tu agente por sensibilidad a latencia. Solo las rutas interactivas (debugging en vivo, computer use, voz) justifican el markup 6x de Ultrafast. Todo lo demás se queda en Standard o migra a Batch/Flex. Si no tienes esa clasificación escrita, la haces hoy.
Adopta el Decisions API para las microdecisiones del bucle: routing, selección de herramienta, gates de aprobación. A $0,10 por millón de entrada sin costo de salida, el costo por decisión cae a fracciones de centavo y eliminas el cuello de botella de meter un modelo de razonamiento en cada paso.
Explota el caché de forma agresiva. Los prompts de sistema largos y estables van cacheados sí o sí; con Ultrafast el ahorro es del 95% sobre la entrada normal. Mide tu tasa de reutilización antes de justificar el tier rápido: si cacheas poco, Ultrafast te sale carísimo.
Revisa rate limits y cuotas antes de prometer nada. Ultrafast consume cuota mucho más rápido y en Codex y ChatGPT Work está restringido a Pro 500 (umbral de $500/mes), Enterprise con uso medido y Edu. Los admins lo habilitan explícitamente, no viene por defecto. Y no fijes tu roadmap a un solo proveedor: con Microsoft a $0,042 y Anthropic a $0,10/$0,50, una capa de abstracción de modelos para arbitrar precio y latencia por tarea deja de ser lujo y pasa a ser higiene.
Si operas agentes en producción, la pregunta ya no es «¿cuál es el modelo más inteligente?». Es «¿cuánto me cuesta cada milisegundo y en qué ruta lo estoy pagando sin necesitarlo?». Cuéntame en los comentarios cómo estás clasificando tus llamadas: ¿tienes tiers por tarea o sigues mandando todo al flagship por default?
Preguntas frecuentes
¿Cuánto cuesta la OpenAI Ultrafast API?
El tier Ultrafast para GPT-6.1 Sol cuesta $12 por millón de tokens de entrada y $60 por millón de salida, 6x las tarifas estándar del modelo ($2/$10). El input cacheado baja a $0,60 por millón y la escritura de caché cuesta $15.
¿La mejora de velocidad es realmente 10x?
No hay confirmación independiente. OpenAI declara hasta 8x en Codex y 6x en la API, sin publicar tokens por segundo ni latencia garantizada de primer token. Una medición independiente encontró solo 4,4x de mejora real.
¿Qué es el Decisions API y para qué sirve?
Es una API de $0,10 por millón de tokens de entrada, sin cargo por salida ni por caché, pensada para microdecisiones dentro de agentes: routing, selección de herramienta y gates de aprobación. No es para generar texto largo.
¿Vale la pena Ultrafast frente a Microsoft-Decision-1?
Depende de la tarea. Microsoft-Decision-1 ofrece $0,042 por millón de entrada con salida gratis y 85 ms de latencia p50, más barato que los $0,10 de OpenAI. Si tu cuello de botella es latencia interactiva, Ultrafast puede justificarse; si es costo por decisión, Microsoft gana en papel.
Fuentes
- Decision models are suddenly everywhere. OpenAI’s is now public — The New Stack
- GPT-6.1 Sol Ultrafast: Speed, Pricing, Plans & Value — Kingy AI
- GPT-6.1 Sol Extreme Edition Launched: $500 Entry Threshold — 36Kr
- SD Times News Roundup: Oct. 9, 2026 — OpenAI adds speed capabilities
- Microsoft AI Releases Microsoft-Decision-1 — MarkTechPost
- OpenAI’s Ultrafast and Decisions API Shift AI Race to Speed, Cost — Forbes