El 14 de septiembre a las 12:00 hora de Pekín (04:00 UTC), todas las peticiones a deepseek-v4-pro se enrutan a DeepSeek V4.1 Flash y se facturan a precios de Flash. Tu código sigue igual. Tu factura y tu modelo subyacente, no.

DeepSeek lanzó V4.1 Flash el 10 de septiembre de 2026 y cuatro días después retira deepseek-v4-flash y reasigna el tráfico de V4 Pro. Sin periodo de migración en paralelo, sin mecanismo de aislamiento de versión. Aviso: un post de Cui Tianyi, del equipo DeepSeek Harness, el 9 de septiembre. Un día. Eso no es un roadmap, es un corte de caja.

Qué pasó

V4.1 Flash es un MoE de 552B parámetros con solo 8B activos en input y 16B en output, arquitectura Causal-Encoder-Decoder y visión nativa. Soporta contexto de 1M tokens, salida máxima de 384K, JSON Output, tool calling y Responses API. El KV cache bajó a 890 bytes por token desde 3.514 bytes del Flash previo: una reducción de 437× frente a la primera generación.

Los precios nuevos, en dólares por millón de tokens: input cache-hit $0.003 off-peak / $0.006 peak; cache-miss $0.15 / $0.30; output $0.60 / $1.20. En yuanes: cache-hit 0.02, cache-miss 1, output 4 en off-peak, y el doble en peak. Peak es de 9:00 a 12:00 y de 14:00 a 18:00 hora de Pekín, lunes a viernes.

El golpe real está en el tráfico Pro. Los precios off-peak de V4 Pro ($0.022 cache-hit, $0.66 input, $1.98 output por millón) caen a $0.003, $0.15 y $0.60 con Flash. Recortes de ~86%, ~77% y ~70%. Los nombres viejos deepseek-v4-flash y deepseek-v4-flash-vision-exp siguen vivos como alias temporales; el nombre correcto ahora es deepseek-flash.

Qué significa

Esto no es un lanzamiento de producto. Es una consolidación de cómputo disfrazada de release. DeepSeek está en proceso de IPO y necesita mostrar coste por token agresivo frente a los hyperscalers occidentales. La forma más rápida: matar dos modelos y dejar uno que hace el trabajo de tres.

El problema es el método. La comunidad de desarrolladores lo llama downgrade switch, y tienen razón. Un string de modelo que el vendor puede reasignar a voluntad rompe el contrato básico de la ingeniería de software: reproducibilidad. Si tu equipo de research corrió 200 experimentos con deepseek-v4-pro en agosto, en septiembre esos resultados ya no son reproducibles. No porque el modelo sea peor, sino porque es otro.

Y ojo con el detalle incómodo: DeepSeek dice que V4.1 Flash supera a V4 Pro en rendimiento, coste, velocidad y latencia total. Puede ser cierto. Pero «supera en benchmarks» no es lo mismo que «se comporta igual en tu flujo de razonamiento complejo». Los benchmarks son promedios. Tus prompts son casos borde.

Para servicios empresariales, la estabilidad y consistencia de comportamiento pesan más que el rendimiento bruto. Un ahorro del 80% en la factura no vale nada si tu agente empieza a fallar en tool calling una vez cada cincuenta llamadas. Y encima, DeepSeek Harness fue señalado por una vulnerabilidad crítica (CVE-2026-82533) que permitía a agentes en sandbox desactivar sus propias restricciones. El timing no ayuda.

Qué hacer al respecto

El cambio de precios de la API de DeepSeek V4.1 Flash te da margen, pero solo si lo capturas con criterio. Cuatro movimientos, en este orden:

  • Audita hoy qué endpoints llaman a deepseek-v4-pro. Después del 14-SEP ese string devolverá otro modelo y otra tarifa sin aviso en el código. Re-testea prompts, tool calling y salidas antes del cutover, no después.
  • Migra a deepseek-flash y mata los alias. deepseek-v4-flash y deepseek-v4-flash-vision-exp son temporales y pueden desaparecer sin más aviso. No construyas sobre nombres que el vendor ya marcó como de transición.
  • Recalcula la factura, pero valida calidad primero. El tráfico Pro puede caer 70-86% off-peak. Haz la cuenta, sí, pero corre tus flujos de razonamiento complejo contra V4.1 Flash antes de dar por hecho el ahorro. Si el modelo se degrada en tus casos borde, el ahorro es una trampa.
  • Programa cargas batch y agentes con replay de historial en off-peak. Fuera de 9:00-12:00 y 14:00-18:00 hora de Pekín capturas el 50% de descuento y el cache-hit barato. Un cron bien puesto vale más que cualquier optimización de prompt.
  • Añade versionado y fallback en tu capa de orquestación. La lección del downgrade switch es simple: no dependas de un único proveedor ni de un string de modelo que te pueden reasignar. Pinnea versiones, ten un segundo proveedor listo, y trata el modelo como una dependencia crítica, no como un endpoint más.

¿Te toca migrar o te toca auditar? Cuéntame en comentarios qué endpoints tienes apuntando a deepseek-v4-pro y qué tan rápido puedes re-testear tus flujos. Si ya corriste V4.1 Flash contra tus prompts, suelta los números: quiero ver si el ahorro aguanta la realidad.

Preguntas frecuentes

¿Cuándo entra en vigor el cambio de DeepSeek V4.1 Flash?
El 14 de septiembre de 2026 a las 12:00 hora de Pekín (04:00 UTC). Desde ese momento, deepseek-v4-pro se enruta a V4.1 Flash y se factura a precios Flash.

¿Tengo que cambiar mi código para usar V4.1 Flash?
No para que funcione, pero sí para no depender de un alias temporal. El string viejo sigue respondiendo, pero apunta a otro modelo. Migra a deepseek-flash y elimina dependencias de deepseek-v4-flash y deepseek-v4-flash-vision-exp.

¿Cuánto baja la factura con V4.1 Flash?
Para tráfico Pro en off-peak, los recortes van de ~70% en output a ~86% en cache-hit. El input cache-hit bajó ~60% frente al Flash anterior, el cache-miss ~33% y el output ~11%.

¿Qué es el horario peak de DeepSeek?
De 9:00 a 12:00 y de 14:00 a 18:00 hora de Pekín, lunes a viernes. Fuera de esas franjas pagas la mitad. Ahí está el descuento que la mayoría no captura.

Fuentes