OpenAI le bajó el precio a GPT-5.6 Luna un 80% en tres semanas y su CFO Sarah Friar lo dijo sin rodeos en la conferencia de Goldman Sachs: correr su modelo en la nube ya es más barato que desplegar GLM 5.3 de Z.ai. Pero el movimiento no es solo una guerra de precios. Es la señal más clara de que OpenAI dejó de competir por inteligencia bruta y empezó a competir por costo por resultado aceptable.

Si tu operación depende de APIs de modelos de frontera, esto cambia tus números hoy, no mañana. Y si estás corriendo open-source chino en clouds de terceros creyendo que te ahorras plata, quizás ya estás pagando de más sin saberlo.

Qué pasó

El 30 de julio de 2026, OpenAI recortó el precio de GPT-5.6 Luna un 80%: de $1.00 a $0.20 por millón de tokens de entrada y de $6.00 a $1.20 por millón de salida. El resultado fue inmediato y brutal: el uso del modelo se disparó aproximadamente 10 veces, según confirmó la propia Friar en el evento.

El contexto no es casualidad. OpenAI lanzó la familia GPT-5.6 (Sol, Terra y Luna) el 9 de julio de 2026, y en apenas tres semanas ya estaba reescribiendo la hoja de precios de su modelo económico. Es un movimiento sin precedentes en velocidad, y responde a una presión directa: los modelos open-weight chinos como GLM 5.3 de Z.ai, DeepSeek V4-Flash y Qwen de Alibaba están comiendo terreno en el segmento de costo, donde antes OpenAI ni siquiera peleaba.

Friar además reveló dos cosas que pasaron más desapercibidas. Primero, que OpenAI está experimentando con modelos de pricing basados en resultados de negocio en lugar de consumo de tokens, apuntando a verticales como diseño de chips, ciencias de la vida y servicios financieros. Segundo, que usaron sus propios modelos para diseñar su chip interno ‘Jalapeno’, que llegó a tape-out en nueve meses.

Qué significa

Hagamos las cuentas porque ahí está la historia. GPT-5.6 Luna a $0.20/$1.20 por millón subcota a Gemini 3.8 Flash de Google ($0.75/$3.75), a DeepSeek V4-Flash ($0.14/$0.28) y a Qwen3.8-Flash-Next de Alibaba (~$0.15/$0.45) en entrada. En tokens puros, DeepSeek y Qwen siguen siendo más baratos. Pero Friar no está comparando tokens: está comparando el costo total de desplegar open-source en una capa cloud contra llamar a su API.

Y ahí tiene razón, al menos parcialmente. Si vos corrés GLM 5.3 en una instancia de AWS o Azure, pagás el cómputo, el markup del cloud, el mantenimiento, el monitoreo y las horas de tu equipo. Cuando sumás todo eso, el precio por token del open-source deja de ser tan atractivo. El claim de Friar —’If you’re deploying Luna and compare that to GLM 5.3 on a cloud layer, we are cheaper’— es una comparación honesta del escenario real que enfrenta la mayoría de las empresas, no del escenario ideal de auto-hosting que venden los puristas del open-source.

Lo segundo, y más importante para tu estrategia, es el giro hacia el pricing por resultados. Friar lo planteó como experimento, pero la dirección es clara: los contratos enterprise van a pasar de pagar por consumo a pagar por entregables. Código reparado, proceso completado, diseño validado. Esto cambia por completo cómo presupuestás IA y cómo medís su ROI. La métrica que está reemplazando al precio por token como unidad de comparación se llama cost per acceptable outcome, y si no la estás midiendo, estás tomando decisiones con datos viejos.

El dato del enterprise respalda el movimiento: el ingreso empresarial creció 32% de junio a julio, contra 20% del ingreso anualizado total. Y para mediados de 2026, los negocios enterprise y consumer ya estaban 50/50, antes de lo previsto. OpenAI está dejando de ser una empresa de consumidores para convertirse en una empresa de infraestructura vertical. El pricing por resultados es la pieza que le falta para cerrar ese círculo.

Ahora, la visión contraria también tiene mérito. Críticos como The Register y VentureBeat señalan que el ‘precio barato’ es engañoso cuando los modelos operan como agentes: el costo real depende de tokens de razonamiento, número de turnos, tool calls y reintentos, no del precio de lista. Y tienen razón. Un agente que razona 20 veces antes de responder te puede costar 10 veces más que el precio de lista por token. La diferencia es que OpenAI ya lo sabe, y por eso está moviendo el pricing hacia resultados: para capturar el valor real que genera el modelo, no el volumen de tokens que consume.

Qué hacer al respecto

Si operás modelos de IA en producción, esto no es teoría. Son cuatro movimientos concretos:

  • Cambiá tu métrica de comparación hoy. Dejá de comparar precio por token y empezá a medir cost per acceptable outcome por tarea. Incluí tokens de razonamiento, tool calls y reintentos. En benchmarks internos, Luna puede costar $0.05 por tarea contra $3.69 de modelos que parecían más baratos en precio de lista.
  • Reevaluá tus workloads de alto volumen. Si tenés agentes repetitivos o procesos batch que antes no eran viables económicamente, volvé a correr los números con Luna a $0.20/$1.20 por millón. El 10x de adopción post-recorte sugiere que el punto de inflexión económico ya se cruzó.
  • Calculá tu costo total real del open-source. Si estás corriendo GLM, DeepSeek o Qwen en clouds de terceros, sumá instancia + markup cloud + mantenimiento + horas de equipo. Comparalo contra Luna. El claim de Friar sugiere que el open-source ya no garantiza ventaja de costo en ese escenario, y los números le dan la razón en muchos casos.
  • Vigilá el pricing por resultados. Si OpenAI lo generaliza, tus contratos enterprise van a cambiar de estructura. Empezá a pensar cómo presupuestar por entregables en lugar de por consumo, y qué métricas de éxito vas a usar para negociar. El que llega preparado a esa conversación, negocia mejor.

Y un bonus: si trabajás en ingeniería o diseño de chips, OpenAI ya validó sus modelos internamente (el chip Jalapeno llegó a tape-out en nueve meses usando sus propios modelos). Codex ya tiene 25 millones de usuarios. Antes de asumir que el open-source es la única vía económica para flujos técnicos especializados, hacé un piloto con Luna o Codex. Los datos de OpenAI sugieren que la brecha se está cerrando más rápido de lo que la mayoría cree.

La guerra de precios de la IA de frontera no terminó. Lo que terminó es la era donde el precio por token era la métrica que importaba. El que siga comparando modelos por dólares por millón de tokens, va a tomar decisiones equivocadas durante los próximos 12 meses. ¿Ya mediste tu costo por resultado aceptable, o seguís comparando precios de lista?

Preguntas frecuentes

¿Cuánto cuesta GPT-5.6 Luna después del recorte del 80%?

GPT-5.6 Luna pasó de $1.00 a $0.20 por millón de tokens de entrada y de $6.00 a $1.20 por millón de tokens de salida, tras el recorte del 80% aplicado el 30 de julio de 2026.

¿Es Luna más barato que los modelos open-source chinos como GLM o DeepSeek?

En tokens puros, DeepSeek V4-Flash ($0.14/$0.28) y Qwen de Alibaba (~$0.15/$0.45) siguen siendo más baratos que Luna ($0.20/$1.20). Pero si comparás el costo total de desplegar open-source en un cloud de terceros (instancia + markup + mantenimiento), el claim de OpenAI de que Luna es más barato que GLM 5.3 en una capa cloud tiene sustento en muchos escenarios reales.

¿Qué es el pricing por resultados (outcome-based) que está probando OpenAI?

Es un modelo de cobro donde el cliente paga por entregables o resultados de negocio (código reparado, proceso completado, diseño validado) en lugar de por consumo de tokens. OpenAI está experimentando con esta estructura apuntando a verticales como diseño de chips, ciencias de la vida y servicios financieros.

¿Por qué el precio por token ya no es la métrica correcta para comparar modelos?

Porque los modelos que operan como agentes consumen tokens de razonamiento, hacen tool calls y reintentos, lo que dispara el costo real muy por encima del precio de lista. La métrica que está reemplazando al precio por token es el cost per acceptable outcome: cuánto te cuesta obtener un resultado aceptable por tarea, incluyendo todos los costos indirectos de inferencia.

Fuentes