2 мин чтения

Симплекс сократил трафик памяти на токен на 44%

ассоциативная памятьсимплексыоптимизация памяти

В техническом обсуждении автор эксперимента сообщил, что замена 2D-куба на 4D-симплекс сократила число обращений к ячейкам с девяти до пяти, а трафик на токен примерно со 111 до 61 КБ, то есть на 44%. Растяжение адресов отдельно резко повысило емкость, сохранив прежний объем вычислений, но потребовало больше памяти.

Что дали растяжение адресов и симплекс

Меня здесь цепляет не геометрия сама по себе, а конкретный результат: в описанном эксперименте 4D-симплекс требует пять обращений к ячейкам вместо девяти у 2D-куба. Трафик на токен снижается примерно со 111 до 61 КБ, то есть на 44%.

Первичный источник этих цифр на момент обсуждения — сообщение автора эксперимента в техническом Telegram-сообществе. Это не опубликованный бенчмарк и не завершенная исследовательская работа, поэтому результаты стоит читать как отчет о текущем прототипе, а не как универсальную характеристику симплексной памяти.

Первая оптимизация еще проще: адреса чтения и записи умножаются на один коэффициент, расширяя доступное адресное пространство. Для 1024 пар исходный показатель находился в диапазоне 0,69–0,73, а с растяжением при γ = 2 вырос до 0,998–0,999. Для 4095 пар переход составил от 0,04–0,05 к 0,94–0,95 при γ = 4.

По сообщению автора, вычислительная работа при таком растяжении не увеличивается. Цена платится памятью: ячеек становится больше. Иными словами, это не бесплатная оптимизация всей системы, а обмен физической емкости на более удачное размещение адресов.

Замена куба симплексом атакует другую статью расходов. При росте размерности кубическая схема быстро увеличивает число читаемых ячеек, тогда как в протестированном варианте симплекс дает более компактную окрестность обращения. Автор также сообщает о заметно лучшей экстраполяции без растяжения и немного более высоком потолке с ним.

Где заканчивается выигрыш

Результат выглядит инженерно значимым, но пока узким: выигрыш относится к конкретной схеме памяти и способу адресации. Переносить цифру 44% на любую нейросетевую память или векторный поиск нельзя.

Первым делом я бы смотрел не только на трафик, но и на полный бюджет памяти, задержку обращения и поведение при шумных запросах. Уже сейчас автор отмечает, что симплексная схема хуже переносит шум в адресах, включая перефразы, и потребляет немного больше памяти. Именно здесь красивое сокращение числа чтений может столкнуться с реальным распределением запросов.

Следующая проверка, 6D-симплекс, на момент сообщения еще считалась. Теоретическое ожидание было оптимистичным, но результата в исходных данных нет, поэтому приписывать ему дополнительный выигрыш рано.

Самое интересное здесь не рекордное число, а форма компромисса: меньше движений данных в обмен на большее хранилище и потенциально меньшую устойчивость к шуму. Судьбу подхода решит не геометрия на бумаге, а то, сохранится ли этот баланс на неоднородных адресах и перефразированных запросах.

Ранее мы разбирали, как конфигурации Claude Opus 4.6 влияют на стоимость контекста и выбор архитектуры. Это дополняет обсуждение новых способов экономнее организовать память LLM.