Память вместо переписывания весов LLM
LLMпамять ИИсамоулучшение агентов
Самоулучшение переезжает из весов в память
Я бы сразу снял с этой темы фантастику: ближайшая практическая версия самоулучшения LLM выглядит как развитие внешнего контура, а не как модель, тайно переписывающая собственные веса. В двух материалах блога Percepta AI, «Can LLMs Grow Their Own Capabilities» и «Spotlight: Memory», именно память оказывается главным пластичным слоем. К октябрю 2026 года это разумнее читать как техническую карту направления, а не как анонс готовой автономной системы.
Базовая модель в такой архитектуре остаётся замороженной или меняется редко. Агент накапливает эпизоды, выводы и оценки полезности, затем решает, что сохранить, обновить, объединить или удалить. Получается цикл: наблюдение, запись, организация, извлечение, рефлексия и корректировка памяти либо окружающего модель программного каркаса.
Ключевой сдвиг здесь не в объёме истории, а в её управляемости. Сырая лента контекста плохо сохраняет связи между событиями и со временем засоряет поиск. Структурированная память раскладывает опыт по иерархиям, графам, доменам или эпизодам, а политики управления определяют, когда сведения нужно переоценить, сжать или забыть.
Исследовательские системы уже разделяют эти подходы. MEMORYLLM использует встраиваемый пул памяти внутри слоёв трансформера, а StructMem и похожие архитектуры организуют записи в связанные структуры. Отдельный бенчмарк StructMemEval проверяет не только воспроизведение фактов, но и способность агента организовать долговременную память. И вот тут стало интересно: объектом оптимизации становится не один ответ модели, а её способ обращаться с накопленным опытом.
Что реально меняется для агентных систем
Главное следствие простое: способности агента могут расти без постоянного дообучения базовой LLM. Это делает адаптацию более управляемой, потому что память можно просматривать, редактировать, ограничивать и очищать отдельно от параметров модели. Для долгих задач такой контур выглядит практичнее идеи бесконтрольного рекурсивного переписывания весов.
Но память не превращает агента в надёжную систему автоматически. Ошибочная структура закрепляет неверные связи, дубликаты раздувают хранилище, а галлюцинации памяти возвращаются в рассуждение как будто это проверенный опыт. По мере роста массива записей узким местом становится не сохранение, а выбор действительно нужного фрагмента.
Я бы первым делом оценивал качество обновлений, забывания и разрешения конфликтов, а не максимальный объём памяти. Если политика управления сохраняет красивую ошибку и удаляет неудобный факт, агент формально учится, но движется не туда. Самый интересный вопрос теперь не в том, сможет ли LLM помнить больше, а в том, кто и как будет управлять тем, чему она учится доверять.