PC-ALM acerca el aprendizaje local a backprop
PC-ALMpredictive codingbackpropagation
Qué cambia exactamente PC-ALM
Para mí, el principal resultado de PC-ALM es que el aprendizaje local se acerca a backpropagation con un número finito de pasos internos. En su publicación “Augmented Lagrangian Predictive Coding”, Sakana AI describe el método como un esquema local por capas con una variable dual independiente para cada capa. A septiembre de 2026, interpreto este trabajo sobre todo como una propuesta de ingeniería para un mecanismo de aprendizaje alternativo.
La mecánica es bastante concreta. El paso habitual de predictive coding con una búsqueda de argmin se sustituye por un paso de gradiente sobre un lagrangiano aumentado. Justo después se actualiza la variable dual y el ciclo se repite dentro del presupuesto de inferencia establecido.
El régimen clave de los experimentos es T=2L, donde el presupuesto de inferencia se vincula con la profundidad de la red. Según el artículo, PC-ALM es comparable con backpropagation en las combinaciones probadas de anchura y profundidad hasta 128 capas. El resultado es especialmente revelador en redes profundas y estrechas: el predictive coding estándar queda por detrás, mientras que el nuevo esquema mantiene la calidad más cerca de BP.
También hay una prueba más extrema. En MNIST, el método entrena MLP residuales de hasta 1.000 capas y se mantiene a aproximadamente dos puntos porcentuales de backpropagation. Las mejoras frente al predictive coding convencional también se muestran en Fashion-MNIST, CIFAR-10 y Tiny ImageNet, incluidos experimentos con ResNet-18.
Por qué es más que un truco de optimización
PC-ALM parece un avance real para el aprendizaje local, pero todavía no una sustitución lista para usar de backpropagation. Lo importante no es la metáfora biológica en sí, sino que un presupuesto finito de actualizaciones deja de deteriorarse al crecer la profundidad en los regímenes mostrados.
Yo comprobaría primero la sensibilidad a T, el coste de memoria de las variables duales y el tiempo total de entrenamiento. Una precisión cercana a BP aún no indica cómo se comporta el método en memoria y cálculo. También interesa su transferencia más allá de las tareas y arquitecturas de clasificación de imágenes presentadas.
Sakana AI ha reducido de forma notable la brecha principal: las señales locales ya no tienen que implicar una pérdida drástica de calidad. La cuestión más exigente sigue abierta: cuánta carga computacional queda oculta dentro de esta aproximación.