Claude Opus 5.5 ясніше пояснює помилки, але любить TLDR
Claude Opus 5.5Anthropicпромпт-инжиниринг
Головна зміна помітна не лише в бенчмарках
Мене тут цікавить не черговий приріст балів, а значно практичніша річ: судячи з відгуку користувача, Claude Opus 5.5 став зрозуміліше пояснювати помилки. Там, де Opus 5 кілька разів натякав на баг «космічною» мовою й не доносив суті, нова версія змогла нормально сформулювати проблему.
Офіційна картина також свідчить про велике оновлення. У документації Claude Platform і примітках до релізу Anthropic модель описують як інструмент для тривалих агентних завдань у програмуванні та роботі зі знаннями. Заявлено контекст в один мільйон токенів, максимальний вивід у 128 тисяч токенів і постійно ввімкнене адаптивне мислення, яким керує налаштування effort.
В опублікованих матеріалах Anthropic результат Opus 5.5 на Terminal-Bench 4.0 становить 66,4% проти 52,3% у Opus 5. На GDPval-AA v2.1 заявлено 1846 Elo проти 1708. Це не окремі тести мовної якості, але вони добре узгоджуються з тим, що модель надійніше утримує складні інструкції та ланцюжки дій.
На момент анонсу ціна становила 4 долари за мільйон вхідних і 20 доларів за мільйон вихідних токенів. Інший користувач також пише, що навіть не наближається до тижневого ліміту. Узагальнювати цей досвід на всіх не варто: витрати суттєво залежать від довжини контексту, режиму роботи та кількості агентних ітерацій.
Ясність зросла, але стилістичні звички лишилися
Для практичної роботи це справжнє покращення: зрозумілий опис бага цінніший за красивий натяк на нього. Якщо модель швидше локалізує причину збою й формулює її звичайною мовою, зменшується кількість уточнювальних запитів і нижчий ризик пропустити важливу деталь за впевненим багатослів'ям.
Але з'являється знайомий стилістичний податок. В обговоренні інший користувач називає TLDR чи не найчастішим словом у текстах недавніх версій Opus. Це анекдотичне спостереження, а не виміряна характеристика моделі, однак сигнал для промпт-інженера зрозумілий: формат відповіді краще задавати явно, особливо якщо автоматичний підсумок ламає очікувану структуру.
Я б насамперед перевіряв не красу одиночної відповіді, а стабільність на довгій серії завдань: чи зберігає модель ясність, чи не повторює резюме та чи не ховає деталі за TLDR. Головна інтрига Opus 5.5 тепер не в тому, чи вміє він міркувати, а в тому, наскільки дисципліновано він це показує.