Claude Opus 5.5 explica mejor los errores, pero adora los TLDR
Claude Opus 5.5Anthropicпромпт-инжиниринг
El cambio principal no se nota solo en los benchmarks
Lo interesante aquí no es otro aumento de puntuación, sino algo más práctico: según la experiencia de un usuario, Claude Opus 5.5 ahora explica los errores con mayor claridad. Donde Opus 5 insinuaba varias veces un fallo con un lenguaje vago, casi «cósmico», sin transmitir la idea central, la versión nueva pudo formular el problema de forma normal.
El panorama oficial también apunta a una actualización importante. La documentación de Claude Platform y las notas de lanzamiento de Anthropic presentan el modelo como una herramienta para tareas agentivas prolongadas en programación y trabajo con conocimiento. Se indican un contexto de un millón de tokens, una salida máxima de 128.000 tokens y razonamiento adaptativo siempre activado, controlado mediante el ajuste effort.
En los materiales publicados por Anthropic, Opus 5.5 logra un 66,4% en Terminal-Bench 4.0, frente al 52,3% de Opus 5. En GDPval-AA v2.1 se le atribuyen 1846 Elo frente a 1708. No son pruebas directas de calidad lingüística, pero encajan con la idea de que el modelo retiene mejor las instrucciones complejas y las cadenas de acciones.
En el lanzamiento, el precio era de 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida. Otro usuario afirma que ni siquiera se acerca al límite semanal. No conviene generalizar esa experiencia: el consumo depende mucho de la longitud del contexto, el modo de trabajo y el número de iteraciones agentivas.
Más claridad, pero los hábitos de estilo continúan
Para el trabajo práctico, es una mejora real: una explicación clara de un bug vale más que una alusión elegante. Si el modelo localiza antes la causa de un fallo y la expresa en lenguaje corriente, se necesitan menos preguntas de seguimiento y hay menos riesgo de perder un detalle importante entre explicaciones seguras y extensas.
Pero queda un coste estilístico conocido. En la conversación, otro usuario describe TLDR como una de las palabras más frecuentes en los textos de las versiones recientes de Opus. Es una observación anecdótica, no una métrica del modelo, pero la señal para quien diseña prompts es clara: conviene definir explícitamente el formato de respuesta, sobre todo si un resumen automático rompe la estructura esperada.
Yo comprobaría primero no la belleza de una respuesta aislada, sino la consistencia en una serie larga de tareas: si conserva la claridad, si evita repetir resúmenes y si no esconde detalles detrás de TLDR. La cuestión clave de Opus 5.5 ya no es si sabe razonar, sino cuán disciplinadamente lo muestra.