2 хв читання

Claude Sonnet 5.5: мільйон токенів і дешевше

Claude Sonnet 5.5AnthropicLLM

Anthropic випустила Claude Sonnet 5.5 як основну модель Sonnet для API. Вона має контекст на один мільйон токенів, вивід до 128 тисяч токенів і ціну від $2 за мільйон вхідних токенів. Реліз важливий поєднанням довгого контексту, адаптивного мислення та заявленої економії до 30% проти Sonnet 5.

Що саме випустила Anthropic

Тут привертає увагу не номер версії, а те, що Anthropic поєднала в Sonnet 5.5 одразу кілька практичних параметрів. На офіційній сторінці Claude Sonnet 5.5 та в огляді моделей Claude Platform компанія називає її основним Sonnet для API й балансом швидкості та інтелекту. Це вже не експериментальна вітрина, а робоча точка входу до лінійки.

Контекст становить 1 млн токенів, а максимальний вивід сягає 128 тисяч токенів. Модель підтримує адаптивне мислення, причому рівень зусилля за замовчуванням установлено на high. В API використовується ідентифікатор claude-sonnet-5-5, що робить міграцію явною, а не прихованою заміною під попередньою назвою.

На момент анонсу базова ціна становила $2 за мільйон вхідних і $10 за мільйон вихідних токенів. Batch API дає знижку 50% в обох напрямках. Для prompt caching читання коштує $0.20 за мільйон токенів, звичайний запис — $2.50, а запис із годинним TTL — $4.

Anthropic заявляє, що типове навантаження може коштувати до 30% дешевше за Sonnet 5, хоча базові тарифи моделей однакові. Отже, головний ефект компанія пов'язує не з новою цифрою в прайсі, а з ефективністю роботи та білінгу.

Де реліз справді змінює розклад

Для API-команд це реальне оновлення, а не проста перестановка моделі в каталозі. Мільйонний контекст цікавий агентам, великим кодовим базам і довгим ланцюжкам документів, а вивід на 128 тисяч токенів знімає частину обмежень із генерації великих артефактів. Але великий ліміт сам по собі не гарантує, що модель однаково добре використовує весь контекст.

Я б насамперед перевіряв три речі:

  • як тримається точність фактів із різних частин довгого промпту;
  • що відбувається із затримкою та витратою токенів за effort high;
  • чи зберігається заявлена економія в реальних агентних циклах з інструментами та кешем.

Найбільше виграють сценарії, де контекст і повторне використання промптів важливіші за мінімальну ціну одного запиту. Ризик лишається знайомим: розумна модель із високим effort легко перетворює економію на вході на великий рахунок за довгі міркування та вивід. Тому інтрига Sonnet 5.5 не в мільйоні токенів, а в тому, наскільки передбачувано ця місткість працює під навантаженням.

Раніше ми розглядали, як Claude Sonnet може підтримувати паралельних агентів для рев'ю коду та виявляти race conditions у pull request. Цей практичний сценарій допомагає зрозуміти, де новий реліз Sonnet здатен вплинути на інженерні процеси.