Локальный инференс: 90 Вт против дорогих GPU
локальный инференсоблачный инференсGPU
Локальный запуск экономит не там, где кажется
Я бы не сводил выбор к цене токена: локальная система в описанном опыте потребляла около 90 Вт и позволяла экспериментировать без страха перед внезапным облачным счетом. В исходном обсуждении участник 144406 приводит Spark как пример такой конфигурации.
Но 90 Вт нельзя считать универсальной цифрой для локального ИИ. Это показатель конкретного режима, модели и оборудования, а не ориентир для обслуживания крупных моделей. Чем выше требования к памяти и производительности, тем быстрее локальная установка превращается из экономного стенда в дорогую стойку с охлаждением.
И вот тут начинается парадокс open-weight экосистемы. Почти ежедневный выпуск китайских моделей расширяет выбор, но одновременно разгоняет спрос на GPU с большой памятью. На момент обсуждения цены на RTX PRO 6000 выросли с 11-13 до 16-17 тысяч долларов.
Облако снимает первоначальные расходы, однако плата идет за каждую активную сессию. Снимки цен середины 2026 года помещали H200 примерно в диапазон 4,50-5,50 доллара в час по базовым тарифам и 1,80-2,80 доллара по отдельным спотовым предложениям. Для редких тяжелых запусков эта арифметика выглядит разумнее покупки ускорителя.
Контраст хорошо виден в статье Anthropic «Automated researchers can reliably mitigate alignment failures» от 28 августа 2026 года. Для автоматизированных исследователей там использовались H200: это уже класс задач, где компактный локальный режим на 90 Вт не является прямой альтернативой.
Выбор теперь определяет загрузка, а не идеология
Локальный инференс выигрывает при постоянной работе, чувствительных данных и необходимости полностью контролировать среду. Облако остается сильнее при нерегулярной загрузке, резких пиках и экспериментах, которым временно нужны ускорители уровня H200.
Первым делом я бы считал не только электричество и почасовой тариф. В локальную модель затрат входят цена GPU, простой, охлаждение, обслуживание и риск быстрого морального устаревания. В облачную входят хранение, передача данных и часы, потерянные из-за плохо настроенного жизненного цикла ресурсов.
Рост цен на RTX PRO 6000 показывает, что open-weight модели не просто демократизируют инференс. Они переносят дефицит с API на железо. Главный нерешенный вопрос теперь не в том, где модель запускается, а в том, насколько полно будет загружен купленный ускоритель.