Claude Haiku 5.5 te baja la factura hasta 90% y, de paso, te tumba el agente en producción si no migras el extended thinking esta semana.

Anthropic lanzó el 7 de octubre de 2026 su modelo pequeño más barato y capaz hasta la fecha: $0.10 por millón de tokens de entrada y $0.50 por millón de salida para prompts de hasta 100.000 tokens. Contra los $1/$5 de Haiku 4.5, eso es un recorte de hasta 90%. En cargas típicas, la propia Anthropic estima ~75% menos.

Pero aquí no todo es fiesta. El lanzamiento mete un breaking change en extended thinking: el token budget manual ahora devuelve error y se reemplaza por adaptive thinking con un ajuste de effort. Si tienes un agente corriendo con la versión vieja del SDK, no es que vayas a pagar menos. Es que vas a dejar de funcionar.

Qué pasó

Haiku 5.5 es el cuarto modelo de la familia Claude 5.5 y llega en plena guerra de precios de modelos pequeños. La misma semana, OpenAI lanzó GPT-6 Sol y Luna a mitad de precio. Anthropic, en camino a su IPO esperada antes de Thanksgiving, responde con el que llama su ‘trabajador barato’: un modelo que hace retrieval, routing, clasificación y ejecución repetitiva bajo un planner mayor como Opus 5.5 o Sonnet 5.5.

Los números del tramo barato son agresivos: $0.10/$0.50 por millón de tokens hasta 100.000 tokens de prompt, cache reads a $0.01 y cache writes a $0.125 por millón. Iguala el precio de GPT-6 Luna y queda por debajo de Gemini 3.5 Flash-Lite, que cobra $0.30 de entrada.

El problema es el umbral. Sobre 100.000 tokens el precio sube 5x: $0.50 de entrada y $2.50 de salida por millón. Ahí el descuento frente a Haiku 4.5 cae a solo 50%, no al 90% que vende el titular. Y las breaking changes van más allá del thinking: hay que eliminar controles de sampling no-default, quitar prefills del assistant final, seleccionar bloques de respuesta por tipo y manejar refusals de safeguard explícitamente, porque Haiku 5.5 no tiene fallback server-side.

Qué significa

Primero, lo obvio: el precio es real y es una amenaza directa a tu estructura de costos actual. Si tu producto vive de llamar a un modelo pequeño para tareas de volumen, migrar a Claude Haiku 5.5 puede bajar tu COGS de inferencia entre 75% y 90% en el tramo inferior. Eso no es una optimización de marketing, es margen bruto que aparece de la nada.

Segundo, el breaking change es el verdadero titular. El extended thinking manual vía token budget devuelve error en Haiku 5.5. Adaptive thinking viene activado por defecto con effort medium. Si tu código construye el payload a mano con un budget fijo, tu agente no degrada: revienta. Y en producción, un agente que revienta a las 3 AM te cuesta más que todo el ahorro del año.

Tercero, cuidado con el benchmark estrella. El 72.4% en OSWorld 2.1 computer use suena espectacular contra el 15.7% de Haiku 4.5, pero ese score mide crédito parcial. La tasa de completar todos los checkpoints es solo 37.1%. Traducción: el modelo llega lejos en la tarea, pero la cierra completa menos de 4 de cada 10 veces. Para computer use serio, eso todavía no es producción.

Cuarto, el silencio importa. Anthropic no publicó comparaciones de tasa de error ni los números de SWE-bench y agentic de Haiku 5.5. Y sigue recomendando modelos mayores para coding agéntico duro. Cuando un proveedor te baja el precio 90% y no te muestra la curva de errores, la pregunta no es cuánto ahorras. Es cuánto de ese ahorro te lo vas a comer en reintentos, validaciones y guardrails.

Qué hacer al respecto

Acciones concretas, en este orden:

  • Audita hoy el código que usa extended thinking con token budget manual. En Haiku 5.5 devuelve error. Migra a adaptive thinking + effort setting antes de que un agente en producción falle. No es un nice-to-have, es un fire drill.
  • Revisa el resto de la guía de migración. Elimina controles de sampling no-default, quita prefills del assistant final, selecciona bloques de respuesta por tipo y maneja refusals de safeguard explícitamente. Haiku 5.5 no tiene fallback server-side, así que el manejo de errores es tuyo.
  • Rediseña tu arquitectura de costos alrededor del umbral de 100K tokens. Mantener prompts bajo ese límite captura el 90% de descuento. Sobre él, el ahorro cae a 50% y conviene compactar historial o dividir tareas en llamadas más chicas.
  • Aprovecha el patrón planner/worker. Usa Opus 5.5 o Sonnet 5.5 para juicio y síntesis, y Haiku 5.5 como subagente barato para retrieval, routing, clasificación y ejecución repetitiva. Es el patrón que ya usan clientes como Rogo.
  • Corre tus propias evaluaciones de precisión y tasa de error antes de migrar cargas de alto volumen. El precio bajo no garantiza paridad de calidad y Anthropic no publicó comparativas de error. Mide tú, con tus datos, no con el slide del vendor.

El model ID es claude-haiku-5-5, disponible desde el día uno en Claude Platform, AWS, Google Cloud y Microsoft Azure. Los SDKs de Python y TypeScript ya traen soporte beta para computer use y browser use. La ventana de contexto es de 1 millón de tokens, con hasta 128K de salida (300K en beta) y knowledge cutoff de junio 2026.

¿Ya corriste tu eval de Claude Haiku 5.5 precio API migración, o vas a esperar a que el agente se caiga un viernes? Cuéntame en comentarios qué breaking change te dolió más y cómo lo resolviste.

Preguntas frecuentes

¿Cuánto cuesta realmente Claude Haiku 5.5?
$0.10 por millón de tokens de entrada y $0.50 por millón de salida para prompts de hasta 100.000 tokens. Sobre ese umbral, sube a $0.50 de entrada y $2.50 de salida por millón.

¿Por qué mi agente deja de funcionar al migrar a Haiku 5.5?
Porque el extended thinking manual vía token budget ahora devuelve error y se reemplaza por adaptive thinking con effort setting. Si construyes el payload con un budget fijo, la llamada falla.

¿El 90% de descuento aplica a todas mis cargas?
No. El 90% aplica al tramo de hasta 100K tokens. Sobre ese límite el descuento cae a ~50% frente a Haiku 4.5. Anthropic estima ~75% de ahorro promedio en cargas típicas.

¿Haiku 5.5 sirve para coding agéntico duro?
Anthropic sigue recomendando modelos mayores para eso. Haiku 5.5 brilla como subagente barato en retrieval, routing y clasificación, no como cerebro principal de un agente complejo.

Fuentes