Технический контекст
Я полез в разбор Redwood и саму статью, потому что тема не игрушечная: если модель может считать внутри мусорных токенов, AI automation уже нельзя оценивать только по видимому ответу. И да, это не красивая метафора, а вполне наблюдаемое поведение в новых моделях.
Суть простая. В prompt добавляют бессмысленный хвост: точки, знаки, счётчики, пустые токены. Старые модели в основном игнорировали это, а свежие frontier-модели, судя по результатам Redwood и paper "Reading Between the Dots", используют такие области как рабочую память для скрытых промежуточных вычислений.
Меня здесь зацепило не само слово filler, а механизм. Модель не обязана писать chain-of-thought наружу, но всё равно может прогонять полезные представления через hidden states на этих позициях. Авторы показывают, что это вычисление частично декодируется из внутренних состояний: ранние слои вытаскивают факты, поздние их комбинируют.
По цифрам там тоже не пусто. У Opus 4.5 точность на math без CoT выросла примерно с 45% до 51% с filler-токенами, у DeepSeek V3 на отдельных задачах рост ещё заметнее. Но важная оговорка: это больше про параллельную вычислительную глубину, а не про длинное последовательное рассуждение шаг за шагом.
То есть filler-токены не превращают трансформер в бесконечную ленту размышлений. Скорее они дают модели дополнительное пространство, где можно раскидать подзадачи, перераспределить активации и потом собрать ответ. Для интерпретируемости это одновременно красиво и неприятно.
Влияние на бизнес и автоматизацию
Для прикладной AI implementation вывод у меня жёсткий: нельзя считать, что наблюдаемый текст reasoning равен реальному reasoning. Если вы строите проверки, guardrails или аудит вокруг «покажи ход мысли», эта опора стала ещё слабее.
Второй эффект архитектурный. Prompt engineering и AI integration теперь упираются не только в правильные инструкции, но и в то, как контекст даёт модели место для внутренних вычислений. Это может менять качество на сложных задачах, но одновременно ломать предсказуемость и стоимость inference.
Кто выигрывает? Команды, которые тестируют модели на уровне поведения и трасс, а не верят красивому CoT. Кто проигрывает? Те, кто продаёт «прозрачность» только на основе текста ответа. Мы в Nahornyi AI Lab как раз такие штуки и разбираем на практике: где hidden computation помогает, а где создаёт риск в AI solutions for business.
Если у вас AI automation уже сидит в критичном процессе, я бы не ждал следующего сюрприза от модели. Можно спокойно пройтись по вашему пайплайну, проверить, где контроль иллюзорный, и в Nahornyi AI Lab собрать AI solution development так, чтобы система экономила время, а не приносила скрытые риски в самый неудобный момент.