2 мин чтения

Локальный инференс: 90 Вт против дорогих GPU

локальный инференсоблачный инференсGPU

Локальный инференс дает предсказуемые расходы и свободу экспериментов: в описанном опыте система на Spark потребляла около 90 Вт. Но дефицит меняет экономику: RTX PRO 6000 подорожала с 11–13 до 16–17 тысяч долларов, тогда как облако сохраняет смысл для нерегулярных задач и доступа к H200.

Локальный запуск экономит не там, где кажется

Я бы не сводил выбор к цене токена: локальная система в описанном опыте потребляла около 90 Вт и позволяла экспериментировать без страха перед внезапным облачным счетом. В исходном обсуждении участник 144406 приводит Spark как пример такой конфигурации.

Но 90 Вт нельзя считать универсальной цифрой для локального ИИ. Это показатель конкретного режима, модели и оборудования, а не ориентир для обслуживания крупных моделей. Чем выше требования к памяти и производительности, тем быстрее локальная установка превращается из экономного стенда в дорогую стойку с охлаждением.

И вот тут начинается парадокс open-weight экосистемы. Почти ежедневный выпуск китайских моделей расширяет выбор, но одновременно разгоняет спрос на GPU с большой памятью. На момент обсуждения цены на RTX PRO 6000 выросли с 11-13 до 16-17 тысяч долларов.

Облако снимает первоначальные расходы, однако плата идет за каждую активную сессию. Снимки цен середины 2026 года помещали H200 примерно в диапазон 4,50-5,50 доллара в час по базовым тарифам и 1,80-2,80 доллара по отдельным спотовым предложениям. Для редких тяжелых запусков эта арифметика выглядит разумнее покупки ускорителя.

Контраст хорошо виден в статье Anthropic «Automated researchers can reliably mitigate alignment failures» от 28 августа 2026 года. Для автоматизированных исследователей там использовались H200: это уже класс задач, где компактный локальный режим на 90 Вт не является прямой альтернативой.

Выбор теперь определяет загрузка, а не идеология

Локальный инференс выигрывает при постоянной работе, чувствительных данных и необходимости полностью контролировать среду. Облако остается сильнее при нерегулярной загрузке, резких пиках и экспериментах, которым временно нужны ускорители уровня H200.

Первым делом я бы считал не только электричество и почасовой тариф. В локальную модель затрат входят цена GPU, простой, охлаждение, обслуживание и риск быстрого морального устаревания. В облачную входят хранение, передача данных и часы, потерянные из-за плохо настроенного жизненного цикла ресурсов.

Рост цен на RTX PRO 6000 показывает, что open-weight модели не просто демократизируют инференс. Они переносят дефицит с API на железо. Главный нерешенный вопрос теперь не в том, где модель запускается, а в том, насколько полно будет загружен купленный ускоритель.

Мы ранее разбирали Cocoon и то, как конфиденциальные вычисления меняют стоимость инференса и требования к приватности. Этот пример дополняет разговор о том, когда собственная инфраструктура оправдана на фоне роста цен на GPU.