2 мин чтения

Claude Sonnet 5.5: миллион токенов и дешевле

Claude Sonnet 5.5AnthropicLLM

Anthropic выпустила Claude Sonnet 5.5 как основную модель Sonnet для API. Она получила контекст в 1 млн токенов, вывод до 128 тысяч токенов и цену от $2 за миллион входных токенов. Важен здесь набор возможностей: длинный контекст, адаптивное мышление и заявленная экономия до 30% по сравнению с Sonnet 5.

Что именно выпустила Anthropic

Меня здесь цепляет не номер версии, а то, что Anthropic собрала в Sonnet 5.5 сразу несколько практичных параметров. На официальной странице Claude Sonnet 5.5 и в обзоре моделей Claude Platform компания называет её основным Sonnet для API и балансом скорости и интеллекта. Это уже не экспериментальная витрина, а рабочая точка входа в линейку.

Контекст составляет 1 млн токенов, максимальный вывод достигает 128 тысяч токенов. Модель поддерживает адаптивное мышление, причём уровень усилия по умолчанию установлен на high. В API используется идентификатор claude-sonnet-5-5, что делает миграцию явной, а не скрытой заменой под прежним именем.

На момент анонса базовая цена составляла $2 за миллион входных и $10 за миллион выходных токенов. Batch API даёт скидку 50% на оба направления. Для prompt caching чтение стоит $0.20 за миллион токенов, обычная запись $2.50, а запись с часовым TTL $4.

Anthropic заявляет, что типичная нагрузка может обходиться до 30% дешевле Sonnet 5, хотя базовые ставки у моделей одинаковые. Значит, главный эффект компания связывает не с новой цифрой в прайсе, а с эффективностью работы и биллинга.

Где релиз действительно меняет расклад

Для API-команд это реальное обновление, а не просто перестановка модели в каталоге. Миллионный контекст интересен агентам, большим кодовым базам и длинным цепочкам документов, а вывод на 128 тысяч токенов снимает часть ограничений с генерации крупных артефактов. Но большой лимит сам по себе не гарантирует, что модель одинаково хорошо использует весь контекст.

Я бы в первую очередь проверял три вещи:

  • как держится точность на фактах из разных частей длинного промпта;
  • что происходит с задержкой и расходом токенов при effort high;
  • сохраняется ли заявленная экономия на реальных агентных циклах с инструментами и кэшем.

Выигрывают сценарии, где контекст и повторное использование промптов важнее минимальной цены одного запроса. Риск остаётся прежним: умная модель с высоким effort легко превращает экономию на входе в большой счёт за длинные рассуждения и вывод. Поэтому интрига Sonnet 5.5 не в миллионе токенов, а в том, насколько предсказуемо эта ёмкость работает под нагрузкой.

Ранее мы разбирали, как Claude Sonnet может поддерживать параллельных агентов для ревью кода и выявлять race conditions в pull request. Этот практический сценарий помогает понять, где новый релиз Sonnet способен изменить инженерные процессы.