C2C transfère le sens entre les LLM via le cache KV
Cache-to-CacheKV-кешмультиагентные системы
Ce que Cache-to-Cache transfère réellement
Le point le plus marquant est que C2C transfère du sens entre des LLM sans passer par une réponse textuelle intermédiaire. Dans l’article Cache-to-Cache publié sur arXiv, les auteurs proposent de prendre le cache KV du modèle source, de le projeter par réseau neuronal dans l’espace de représentation du modèle destinataire, puis de le fusionner avec le cache de ce dernier. Le destinataire peut alors poursuivre le décodage comme si le contexte nécessaire était déjà intégré à son état interne.
Les deux modèles commencent par effectuer le prefill sur un contexte commun et construisent leurs propres caches KV. Un fuser entraînable projette ensuite, couche par couche, les états sélectionnés de la source vers les couches correspondantes du destinataire ; une fusion résiduelle ajoute la sémantique transférée, tandis qu’un gate entraînable décide quelles couches doivent être modifiées. Le détail est important : une injection brute dans toutes les couches ressemblerait davantage à une dégradation des représentations qu’à un protocole de communication.
Les expériences oracle ont montré qu’il était possible d’enrichir la sémantique d’un cache KV sans en augmenter la taille. Au moment de la publication, les auteurs rapportaient un gain moyen de précision de 6,4 à 14,2 points de pourcentage par rapport à des modèles isolés, et de 3,1 à 5,4 points par rapport à un transfert par texte. L’idée ne repose donc pas uniquement sur de belles visualisations d’états cachés, mais aussi sur des résultats de tâches.
Le travail est daté d’octobre 2025 : il vaut donc mieux le lire aujourd’hui comme une piste de recherche que comme une actualité immédiate. Le dépôt officiel d’implémentation rend C2C plus concret qu’un simple concept, sans pour autant en faire un protocole universel.
Ce qui change pour les systèmes multi-agents
Le bénéfice pratique est clair : les modèles n’ont plus besoin d’emballer leur état de travail dans du texte, puis de demander à un autre modèle de le réinterpréter. Cela peut réduire la consommation de tokens et la latence d’un handoff textuel, tout en préservant une sémantique qu’un message ordinaire pourrait perdre.
Les assemblages de modèles préparés à l’avance et ayant accès aux caches internes sont les plus susceptibles d’en profiter. En contrepartie, l’universalité est limitée : C2C dépend d’un projecteur entraîné, de l’alignement des couches et d’interfaces compatibles. Un adaptateur pour une paire arbitraire de modèles n’apparaît pas spontanément.
Ma principale question ne porte pas sur la précision, mais sur la contrôlabilité. Les échanges textuels sont simples à enregistrer et à auditer, alors qu’un cache KV fusionné reste un état interne opaque. L’enjeu n’est plus de savoir si un cache peut transporter du sens, mais combien de paires de modèles devront être entraînées à se comprendre à nouveau.