PC-ALM приближает локальное обучение к backprop
PC-ALMpredictive codingbackpropagation
Что именно меняет PC-ALM
Для меня главный результат PC-ALM в том, что локальное обучение приблизилось к backpropagation при конечном числе внутренних шагов. Sakana AI в публикации «Augmented Lagrangian Predictive Coding» описывает метод как послойно локальную схему с отдельной двойственной переменной для каждого слоя. К сентябрю 2026 года я читаю эту работу прежде всего как инженерную заявку на альтернативный механизм обучения.
Механика выглядит довольно конкретно. Обычный шаг predictive coding с поиском argmin заменяется градиентным шагом по дополненному лагранжиану. Сразу после него обновляется двойственная переменная, затем цикл повторяется в пределах заданного бюджета инференса.
Ключевой режим в экспериментах задан как T=2L, где бюджет инференса связан с глубиной сети. По данным статьи, PC-ALM сопоставим с backpropagation в проверенных сочетаниях ширины и глубины вплоть до 128 слоёв. Особенно показателен результат на глубоких узких сетях: стандартный predictive coding там отстаёт, а новая схема удерживает качество ближе к BP.
Есть и более экстремальная проверка. На MNIST метод обучает residual MLP глубиной до 1000 слоёв и остаётся примерно в двух процентных пунктах от backpropagation. Улучшения относительно обычного predictive coding также показаны на Fashion-MNIST, CIFAR-10 и Tiny ImageNet, включая эксперименты с ResNet-18.
Почему это больше, чем трюк с оптимизатором
PC-ALM выглядит как реальный шаг для локального обучения, но пока не как готовая замена backpropagation. Мне здесь важна не биологическая метафора сама по себе, а то, что конечный бюджет обновлений перестаёт разваливаться с ростом глубины в показанных режимах.
Первым я бы проверял чувствительность к T, стоимость хранения двойственных переменных и итоговое время обучения. Точность рядом с BP ещё не говорит, как метод поведёт себя по памяти и вычислениям. Не менее интересен перенос за пределы представленных задач классификации изображений и архитектур.
Главный разрыв Sakana AI заметно сократила: локальные сигналы уже не обязаны означать резкую потерю качества. Теперь открытым остаётся более жёсткий вопрос, сколько вычислительной цены скрыто внутри этого приближения.