2 мин чтения

Portal экономит до 90% токенов Claude Code

Claude CodePortalуправление контекстом

Portal от Spotify снизил средний расход токенов примерно на 90% в сценариях массового чтения файлов Claude Code. Плагин shunt перенаправляет такие операции меньшей модели, например Gemini 2.5 Flash, а основному агенту возвращает сжатый результат. Это важно как практичная архитектура управления контекстом, а не новый кодовый интеллект.

Portal сокращает контекст до того, как его увидит Claude

Меня здесь цепляет не цифра сама по себе, а место, где Portal убирает расход: до того, как содержимое больших файлов попадёт в контекст Claude Code. В инженерной статье Spotify «Portal by Spotify cut my Claude Code token usage by 90%» средняя экономия на массовом чтении оценивается примерно в 90%.

Portal не заменяет основную модель и не делает её умнее. Это промежуточный слой: операции вроде чтения множества файлов передаются меньшей модели, например Gemini 2.5 Flash, а Claude получает уже сжатое резюме или нужные фрагменты. Основной агент сохраняет контекст для планирования, рассуждений и правок кода вместо повторного поглощения сырого текста.

За маршрутизацию отвечает плагин shunt. В материале приведена команда claude plugin install shunt@portal, которая показывает сам формат интеграции: оптимизация добавляется как плагин, а не как новая версия Claude Code.

На момент описанного эксперимента показатель относился прежде всего к bulk-read сценариям. Это важная оговорка: речь не об универсальном сокращении любого расхода на 90%, а о конкретном классе задач, где агент сканирует крупные файлы, повторно читает части репозитория или разбирает монорепозиторий. Именно там управление контекстом даёт максимальный эффект.

Экономия реальна, но качество упирается в маршрутизацию

Практический выигрыш здесь реальный, но узкий: дорогая модель перестаёт работать как файловый пылесос. Разработчик получает более компактный контекст, а основная модель тратит внимание на задачи, для которых действительно нужен сильный reasoning.

Первым делом я бы проверял не общий процент экономии, а потери при сжатии. Если меньшая модель пропустит условие в конфигурации, связь между модулями или значимый комментарий, Claude будет уверенно рассуждать по неполной карте проекта. Следующие точки контроля очевидны: насколько правильно классифицируются задачи, как часто требуется повторное чтение и меняется ли качество итоговых правок.

Для генерации кода расклад может быть другим: основному агенту не всегда нужно читать весь созданный шаблонный код. Поэтому Portal выглядит не как волшебный ускоритель Claude Code, а как удачная реализация старой инженерной идеи: сильная модель не должна видеть всё. Главный нерешённый вопрос теперь не размер контекста, а то, кто и насколько надёжно решает, что из него выбросить.

Мы ранее разбирали, как параллельные агенты Claude Code помогают находить race conditions в pull request и контролировать расходы на модели. Этот подход дополняет опыт Spotify Portal по снижению потребления токенов в разработке.