C2C transfiere significado entre LLM mediante la caché KV
Cache-to-CacheKV-кешмультиагентные системы
Qué transfiere exactamente Cache-to-Cache
Lo más llamativo es que C2C transfiere significado entre LLM sin una respuesta textual intermedia. En el artículo Cache-to-Cache de arXiv, los autores proponen tomar la caché KV del modelo fuente, trasladarla mediante una red neuronal al espacio de representaciones del modelo receptor y fusionarla con su propia caché. A partir de ahí, el receptor continúa la decodificación como si el contexto necesario ya estuviera integrado en su estado interno.
Primero, ambos modelos ejecutan el prefill sobre un contexto compartido y construyen sus propias cachés KV. Después, un fuser entrenable proyecta capa por capa los estados elegidos del origen hacia las capas correspondientes del receptor; la fusión residual añade la semántica transferida y un gate entrenable decide qué capas conviene modificar. Es un detalle importante: inyectar información de forma indiscriminada en todas las capas se parecería más a corromper representaciones que a establecer un protocolo de comunicación.
Los experimentos oráculo mostraron que la semántica de la caché KV puede enriquecerse sin aumentar su tamaño. En el momento de la publicación, los autores informaron de mejoras medias de precisión de 6,4 a 14,2 puntos porcentuales frente a modelos aislados, y de 3,1 a 5,4 puntos frente a la transferencia por texto. La propuesta no se apoya solo en visualizaciones atractivas de estados ocultos, sino también en resultados de tareas.
El trabajo está fechado en octubre de 2025, por lo que hoy conviene leerlo como una dirección de investigación y no como una noticia del día. El repositorio oficial de implementación hace que C2C sea más tangible que un concepto abstracto, pero no lo convierte en un protocolo universal.
Qué cambia para los sistemas multiagente
La ganancia práctica es clara: los modelos ya no tienen que empaquetar el estado de trabajo en texto para que otro modelo vuelva a interpretarlo. Esto puede reducir el consumo de tokens y la latencia del relevo textual, al tiempo que conserva semántica que un mensaje ordinario podría perder.
Las combinaciones de modelos preparadas de antemano y con acceso a cachés internas son las que más pueden beneficiarse. La contrapartida es la falta de universalidad: C2C depende de un proyector entrenado, de la alineación entre capas y de interfaces compatibles. Un adaptador para cualquier par de modelos no aparece por sí solo.
Mi principal duda no es la precisión, sino la capacidad de control. Los intercambios de texto son fáciles de registrar y revisar, mientras que una caché KV fusionada sigue siendo un estado interno opaco. La cuestión ya no es si una caché puede transportar significado, sino cuántos pares de modelos habrá que entrenar para que se entiendan desde cero.