Skip to main content
LLMинтерпретируемостьбезопасность ИИ

LLM начали считать внутри filler-токенов

Redwood Research и новая статья на arXiv показали, что современные LLM используют filler-токены как скрытый вычислительный слой. Это не просто трюк, а фундаментальное изменение в том, как мы понимаем AI-рассуждения, контроль reasoning и интеграцию в бизнес-процессы. Это открытие меняет подходы к безопасности и прозрачности.

Технический контекст

Я полез в разбор Redwood и саму статью, потому что тема не игрушечная: если модель может считать внутри мусорных токенов, AI automation уже нельзя оценивать только по видимому ответу. И да, это не красивая метафора, а вполне наблюдаемое поведение в новых моделях.

Суть простая. В prompt добавляют бессмысленный хвост: точки, знаки, счётчики, пустые токены. Старые модели в основном игнорировали это, а свежие frontier-модели, судя по результатам Redwood и paper "Reading Between the Dots", используют такие области как рабочую память для скрытых промежуточных вычислений.

Меня здесь зацепило не само слово filler, а механизм. Модель не обязана писать chain-of-thought наружу, но всё равно может прогонять полезные представления через hidden states на этих позициях. Авторы показывают, что это вычисление частично декодируется из внутренних состояний: ранние слои вытаскивают факты, поздние их комбинируют.

По цифрам там тоже не пусто. У Opus 4.5 точность на math без CoT выросла примерно с 45% до 51% с filler-токенами, у DeepSeek V3 на отдельных задачах рост ещё заметнее. Но важная оговорка: это больше про параллельную вычислительную глубину, а не про длинное последовательное рассуждение шаг за шагом.

То есть filler-токены не превращают трансформер в бесконечную ленту размышлений. Скорее они дают модели дополнительное пространство, где можно раскидать подзадачи, перераспределить активации и потом собрать ответ. Для интерпретируемости это одновременно красиво и неприятно.

Влияние на бизнес и автоматизацию

Для прикладной AI implementation вывод у меня жёсткий: нельзя считать, что наблюдаемый текст reasoning равен реальному reasoning. Если вы строите проверки, guardrails или аудит вокруг «покажи ход мысли», эта опора стала ещё слабее.

Второй эффект архитектурный. Prompt engineering и AI integration теперь упираются не только в правильные инструкции, но и в то, как контекст даёт модели место для внутренних вычислений. Это может менять качество на сложных задачах, но одновременно ломать предсказуемость и стоимость inference.

Кто выигрывает? Команды, которые тестируют модели на уровне поведения и трасс, а не верят красивому CoT. Кто проигрывает? Те, кто продаёт «прозрачность» только на основе текста ответа. Мы в Nahornyi AI Lab как раз такие штуки и разбираем на практике: где hidden computation помогает, а где создаёт риск в AI solutions for business.

Если у вас AI automation уже сидит в критичном процессе, я бы не ждал следующего сюрприза от модели. Можно спокойно пройтись по вашему пайплайну, проверить, где контроль иллюзорный, и в Nahornyi AI Lab собрать AI solution development так, чтобы система экономила время, а не приносила скрытые риски в самый неудобный момент.

Мы уже рассматривали возможности расширенного мышления в моделях Claude Opus 4.6 — ключевой шаг к пониманию внутренних рассуждений AI. Открытие филлер-токенов в новом исследовании Redwood Research дополняет эту картину, показывая, что даже без внешних признаков модели могут вести скрытые вычисления.

Поделиться статьёй