2 хв читання

Claude Opus 5.5 ясніше пояснює помилки, але любить TLDR

Claude Opus 5.5Anthropicпромпт-инжиниринг

За відгуками користувачів, Claude Opus 5.5 значно зрозуміліше пояснює помилки, ніж Opus 5, а тижневий ліміт може здаватися щедрим. Anthropic заявляє контекст в один мільйон токенів і вивід до 128 тисяч токенів. Водночас звичка моделі додавати TLDR лишається помітним стилістичним шумом.

Головна зміна помітна не лише в бенчмарках

Мене тут цікавить не черговий приріст балів, а значно практичніша річ: судячи з відгуку користувача, Claude Opus 5.5 став зрозуміліше пояснювати помилки. Там, де Opus 5 кілька разів натякав на баг «космічною» мовою й не доносив суті, нова версія змогла нормально сформулювати проблему.

Офіційна картина також свідчить про велике оновлення. У документації Claude Platform і примітках до релізу Anthropic модель описують як інструмент для тривалих агентних завдань у програмуванні та роботі зі знаннями. Заявлено контекст в один мільйон токенів, максимальний вивід у 128 тисяч токенів і постійно ввімкнене адаптивне мислення, яким керує налаштування effort.

В опублікованих матеріалах Anthropic результат Opus 5.5 на Terminal-Bench 4.0 становить 66,4% проти 52,3% у Opus 5. На GDPval-AA v2.1 заявлено 1846 Elo проти 1708. Це не окремі тести мовної якості, але вони добре узгоджуються з тим, що модель надійніше утримує складні інструкції та ланцюжки дій.

На момент анонсу ціна становила 4 долари за мільйон вхідних і 20 доларів за мільйон вихідних токенів. Інший користувач також пише, що навіть не наближається до тижневого ліміту. Узагальнювати цей досвід на всіх не варто: витрати суттєво залежать від довжини контексту, режиму роботи та кількості агентних ітерацій.

Ясність зросла, але стилістичні звички лишилися

Для практичної роботи це справжнє покращення: зрозумілий опис бага цінніший за красивий натяк на нього. Якщо модель швидше локалізує причину збою й формулює її звичайною мовою, зменшується кількість уточнювальних запитів і нижчий ризик пропустити важливу деталь за впевненим багатослів'ям.

Але з'являється знайомий стилістичний податок. В обговоренні інший користувач називає TLDR чи не найчастішим словом у текстах недавніх версій Opus. Це анекдотичне спостереження, а не виміряна характеристика моделі, однак сигнал для промпт-інженера зрозумілий: формат відповіді краще задавати явно, особливо якщо автоматичний підсумок ламає очікувану структуру.

Я б насамперед перевіряв не красу одиночної відповіді, а стабільність на довгій серії завдань: чи зберігає модель ясність, чи не повторює резюме та чи не ховає деталі за TLDR. Головна інтрига Opus 5.5 тепер не в тому, чи вміє він міркувати, а в тому, наскільки дисципліновано він це показує.

Раніше ми розглядали, як Anthropic скасувала приховане зниження якості відповідей Claude на запити, і що це виявило щодо прозорості поведінки моделей. Дискусія навколо Opus 5.5 так само показує, чому зміни якості відповідей потребують чіткої перевірки, а не сліпої довіри.