2 мин чтения

Claude Opus 5.5 яснее объясняет ошибки, но любит TLDR

Claude Opus 5.5Anthropicпромпт-инжиниринг

По пользовательским отзывам, Claude Opus 5.5 заметно понятнее объясняет ошибки, чем Opus 5, а недельный лимит может ощущаться щедрым. Anthropic заявляет контекст в один миллион токенов и вывод до 128 тысяч токенов. Однако привычка модели добавлять TLDR остается заметным стилевым шумом.

Главное изменение заметно не только в бенчмарках

Меня здесь цепляет не очередной прирост баллов, а более приземленная вещь: Claude Opus 5.5, судя по пользовательскому отзыву, стал яснее объяснять ошибки. Там, где Opus 5 несколько раз намекал на баг «космическим» языком и не доносил суть, новая версия смогла нормально сформулировать проблему.

Официальная картина тоже показывает крупное обновление. В документации Claude Platform и примечаниях к выпуску Anthropic модель описана как инструмент для длительных агентных задач в программировании и работе со знаниями. Указаны контекст в 1 млн токенов, максимальный вывод в 128 тыс. токенов и постоянно включенное адаптивное мышление, которым управляет настройка effort.

В опубликованных материалах Anthropic результат Opus 5.5 на Terminal-Bench 4.0 составляет 66,4% против 52,3% у Opus 5. На GDPval-AA v2.1 заявлены 1846 Elo против 1708. Это не отдельные тесты качества языка, но они хорошо согласуются с тем, что сложные инструкции и цепочки действий модель удерживает надежнее.

На момент анонса цена составляла $4 за миллион входных и $20 за миллион выходных токенов. Отдельный пользователь также пишет, что даже близко не подходит к недельному лимиту. Обобщать такой опыт на всех нельзя: расход сильно зависит от длины контекста, режима работы и количества агентных итераций.

Ясность выросла, стилевые привычки остались

Для практической работы это реальное улучшение: понятное описание бага ценнее красивого намека на него. Если модель быстрее локализует причину сбоя и формулирует ее обычным языком, сокращается число уточняющих запросов и меньше шансов пропустить важную деталь за уверенным многословием.

Но появился знакомый стилевой налог. В обсуждении другой пользователь называет TLDR едва ли не самым частым словом в текстах недавних версий Opus. Это анекдотическое наблюдение, не измеренная характеристика модели, однако для промпт-инженера сигнал понятный: формат ответа лучше задавать явно, особенно если автоматическая сводка ломает ожидаемую структуру.

Я бы первым делом проверял не красоту одиночного ответа, а стабильность на длинной серии задач: сохраняет ли модель ясность, не повторяет ли резюме и не прячет ли детали за TLDR. Главная интрига Opus 5.5 теперь не в том, умеет ли он рассуждать, а в том, насколько дисциплинированно он это показывает.

Ранее мы разбирали, как Anthropic отменила скрытое понижение качества ответов Claude на запросы и что это показало о прозрачности поведения моделей. Дискуссия вокруг Opus 5.5 similarly показывает, почему изменения качества вывода требуют внимательной проверки, а не слепого доверия.