Claude Sonnet 5.5: un millón de tokens por menos
Claude Sonnet 5.5AnthropicLLM
Qué lanzó exactamente Anthropic
Lo llamativo no es el número de versión, sino la combinación de capacidades prácticas que Anthropic ha reunido en Sonnet 5.5. En la página oficial de Claude Sonnet 5.5 y en el resumen de modelos de Claude Platform, la empresa la presenta como el Sonnet principal para API y como un equilibrio entre velocidad e inteligencia. Ya no es una vitrina experimental, sino una puerta de entrada operativa a la familia de modelos.
La ventana de contexto alcanza un millón de tokens y la salida máxima llega a 128.000 tokens. El modelo admite razonamiento adaptativo, con el nivel de esfuerzo configurado en high de forma predeterminada. En la API utiliza el identificador claude-sonnet-5-5, por lo que la migración es explícita y no una sustitución silenciosa bajo un nombre anterior.
En el lanzamiento, el precio base era de $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Batch API ofrece un descuento del 50% en ambos sentidos. Para prompt caching, las lecturas cuestan $0.20 por millón de tokens, las escrituras estándar $2.50 y las escrituras con TTL de una hora $4.
Anthropic afirma que una carga típica puede costar hasta un 30% menos que con Sonnet 5, aunque ambas tienen las mismas tarifas base. Por tanto, el principal beneficio no parece estar en una nueva cifra de lista, sino en una mayor eficiencia operativa y de facturación.
Dónde el lanzamiento cambia realmente el panorama
Para los equipos que trabajan con API, esta es una actualización relevante y no un simple cambio de posición en el catálogo. Un contexto de un millón de tokens interesa a los agentes, las bases de código grandes y las cadenas documentales extensas, mientras que 128.000 tokens de salida eliminan parte de las limitaciones para generar artefactos de gran tamaño. Sin embargo, un límite alto no garantiza por sí solo que el modelo aproveche todo el contexto con la misma calidad.
Yo comprobaría primero tres aspectos:
- cómo mantiene la precisión sobre hechos situados en distintas partes de un prompt largo;
- qué ocurre con la latencia y el consumo de tokens cuando el esfuerzo está en high;
- si el ahorro anunciado se mantiene en ciclos reales de agentes con herramientas y caché.
Los mejores escenarios son aquellos donde la capacidad de contexto y la reutilización de prompts importan más que el coste mínimo de cada solicitud. El riesgo habitual sigue presente: un modelo competente con esfuerzo alto puede convertir el ahorro en la entrada en una factura elevada por razonamientos y salidas extensos. La cuestión con Sonnet 5.5 no es el millón de tokens, sino cuán predecible resulta esa capacidad bajo carga.