2 мин чтения

PC-ALM приближает локальное обучение к backprop

PC-ALMpredictive codingbackpropagation

PC-ALM от Sakana AI обновляет predictive coding с помощью двойственной переменной на каждом слое и шага по дополненному лагранжиану. При бюджете инференса T=2L метод приближается к backpropagation в проверенных моделях, уверенно работает до 128 слоёв и обучает 1000-слойные residual MLP на MNIST с отставанием примерно в два процентных пункта.

Что именно меняет PC-ALM

Для меня главный результат PC-ALM в том, что локальное обучение приблизилось к backpropagation при конечном числе внутренних шагов. Sakana AI в публикации «Augmented Lagrangian Predictive Coding» описывает метод как послойно локальную схему с отдельной двойственной переменной для каждого слоя. К сентябрю 2026 года я читаю эту работу прежде всего как инженерную заявку на альтернативный механизм обучения.

Механика выглядит довольно конкретно. Обычный шаг predictive coding с поиском argmin заменяется градиентным шагом по дополненному лагранжиану. Сразу после него обновляется двойственная переменная, затем цикл повторяется в пределах заданного бюджета инференса.

Ключевой режим в экспериментах задан как T=2L, где бюджет инференса связан с глубиной сети. По данным статьи, PC-ALM сопоставим с backpropagation в проверенных сочетаниях ширины и глубины вплоть до 128 слоёв. Особенно показателен результат на глубоких узких сетях: стандартный predictive coding там отстаёт, а новая схема удерживает качество ближе к BP.

Есть и более экстремальная проверка. На MNIST метод обучает residual MLP глубиной до 1000 слоёв и остаётся примерно в двух процентных пунктах от backpropagation. Улучшения относительно обычного predictive coding также показаны на Fashion-MNIST, CIFAR-10 и Tiny ImageNet, включая эксперименты с ResNet-18.

Почему это больше, чем трюк с оптимизатором

PC-ALM выглядит как реальный шаг для локального обучения, но пока не как готовая замена backpropagation. Мне здесь важна не биологическая метафора сама по себе, а то, что конечный бюджет обновлений перестаёт разваливаться с ростом глубины в показанных режимах.

Первым я бы проверял чувствительность к T, стоимость хранения двойственных переменных и итоговое время обучения. Точность рядом с BP ещё не говорит, как метод поведёт себя по памяти и вычислениям. Не менее интересен перенос за пределы представленных задач классификации изображений и архитектур.

Главный разрыв Sakana AI заметно сократила: локальные сигналы уже не обязаны означать резкую потерю качества. Теперь открытым остаётся более жёсткий вопрос, сколько вычислительной цены скрыто внутри этого приближения.

Ранее мы разбирали, как метрики IRT помогают измерять надёжность систем LLM-as-a-Judge. Эта перспектива оценки также задаёт рамку для того, что новые исследования вроде PC-ALM должны подтвердить на практике.