Claude Opus 5.5 яснее объясняет ошибки, но любит TLDR
Claude Opus 5.5Anthropicпромпт-инжиниринг
Главное изменение заметно не только в бенчмарках
Меня здесь цепляет не очередной прирост баллов, а более приземленная вещь: Claude Opus 5.5, судя по пользовательскому отзыву, стал яснее объяснять ошибки. Там, где Opus 5 несколько раз намекал на баг «космическим» языком и не доносил суть, новая версия смогла нормально сформулировать проблему.
Официальная картина тоже показывает крупное обновление. В документации Claude Platform и примечаниях к выпуску Anthropic модель описана как инструмент для длительных агентных задач в программировании и работе со знаниями. Указаны контекст в 1 млн токенов, максимальный вывод в 128 тыс. токенов и постоянно включенное адаптивное мышление, которым управляет настройка effort.
В опубликованных материалах Anthropic результат Opus 5.5 на Terminal-Bench 4.0 составляет 66,4% против 52,3% у Opus 5. На GDPval-AA v2.1 заявлены 1846 Elo против 1708. Это не отдельные тесты качества языка, но они хорошо согласуются с тем, что сложные инструкции и цепочки действий модель удерживает надежнее.
На момент анонса цена составляла $4 за миллион входных и $20 за миллион выходных токенов. Отдельный пользователь также пишет, что даже близко не подходит к недельному лимиту. Обобщать такой опыт на всех нельзя: расход сильно зависит от длины контекста, режима работы и количества агентных итераций.
Ясность выросла, стилевые привычки остались
Для практической работы это реальное улучшение: понятное описание бага ценнее красивого намека на него. Если модель быстрее локализует причину сбоя и формулирует ее обычным языком, сокращается число уточняющих запросов и меньше шансов пропустить важную деталь за уверенным многословием.
Но появился знакомый стилевой налог. В обсуждении другой пользователь называет TLDR едва ли не самым частым словом в текстах недавних версий Opus. Это анекдотическое наблюдение, не измеренная характеристика модели, однако для промпт-инженера сигнал понятный: формат ответа лучше задавать явно, особенно если автоматическая сводка ломает ожидаемую структуру.
Я бы первым делом проверял не красоту одиночного ответа, а стабильность на длинной серии задач: сохраняет ли модель ясность, не повторяет ли резюме и не прячет ли детали за TLDR. Главная интрига Opus 5.5 теперь не в том, умеет ли он рассуждать, а в том, насколько дисциплинированно он это показывает.