Пам’ять замість переписування ваг LLM
LLMпамять ИИсамоулучшение агентов
Самовдосконалення переходить із ваг у пам’ять
Варто одразу прибрати з цієї теми фантастику: найближча практична версія самовдосконалення LLM має вигляд розвитку зовнішнього контуру, а не моделі, що потай переписує власні ваги. У двох матеріалах блогу Percepta AI — Can LLMs Grow Their Own Capabilities і Spotlight: Memory — саме пам’ять постає головним пластичним шаром. Станом на жовтень 2026 року розумніше сприймати це як технічну карту напряму, а не як анонс готової автономної системи.
Базова модель у такій архітектурі залишається замороженою або змінюється рідко. Агент накопичує епізоди, висновки та оцінки корисності, а потім вирішує, що зберегти, оновити, об’єднати чи видалити. Утворюється цикл: спостереження, запис, організація, вилучення, рефлексія та коригування пам’яті або програмного каркаса навколо моделі.
Ключова зміна тут не в обсязі історії, а в керованості нею. Сирий потік контексту погано зберігає зв’язки між подіями й з часом засмічує пошук. Структурована пам’ять розкладає досвід за ієрархіями, графами, доменами або епізодами, а політики керування визначають, коли відомості слід переоцінити, стиснути чи забути.
Дослідницькі системи вже розділяють ці підходи. MEMORYLLM використовує вбудований пул пам’яті всередині шарів трансформера, тоді як StructMem і подібні архітектури організовують записи у пов’язані структури. Окремий бенчмарк StructMemEval перевіряє не лише відтворення фактів, а й здатність агента організовувати довгострокову пам’ять. Саме тут стає цікаво: об’єктом оптимізації є вже не одна відповідь моделі, а спосіб її роботи з накопиченим досвідом.
Що насправді змінюється для агентних систем
Головний наслідок простий: можливості агента можуть зростати без постійного донавчання базової LLM. Це робить адаптацію керованішою, адже пам’ять можна переглядати, редагувати, обмежувати й очищати окремо від параметрів моделі. Для тривалих завдань такий контур виглядає практичнішим за ідею неконтрольованого рекурсивного переписування ваг.
Проте пам’ять не робить агента надійною системою автоматично. Помилкова структура закріплює хибні зв’язки, дублікати роздувають сховище, а галюцинації пам’яті повертаються в міркування наче перевірений досвід. У міру зростання масиву записів вузьким місцем стає не збереження, а вибір справді потрібного фрагмента.
Я б насамперед оцінював якість оновлень, забування та розв’язання конфліктів, а не максимальний обсяг пам’яті. Якщо політика керування зберігає красиву помилку й видаляє незручний факт, агент формально навчається, але рухається не туди. Найцікавіше питання тепер не в тому, чи зможе LLM пам’ятати більше, а в тому, хто і як керуватиме тим, чому вона вчиться довіряти.