2 Min. Lesezeit

C2C überträgt Bedeutung zwischen LLMs per KV-Cache

Cache-to-CacheKV-кешмультиагентные системы

Cache-to-Cache überträgt Bedeutung zwischen LLMs ohne eine zwischengeschaltete Textnachricht. Der KV-Cache eines Modells wird in den internen Raum eines anderen projiziert und mit dessen Cache verschmolzen. Tests zeigen Genauigkeitsgewinne, doch für jedes konkrete Modellpaar wird weiterhin ein trainierter Adapter benötigt.

Was Cache-to-Cache tatsächlich überträgt

Der entscheidende Punkt ist: C2C überträgt Bedeutung zwischen LLMs ohne eine zwischengeschaltete Textantwort. Im arXiv-Paper Cache-to-Cache schlagen die Autoren vor, den KV-Cache eines Quellmodells zu nehmen, ihn mit einem neuronalen Netz in den Repräsentationsraum des Empfängermodells zu übertragen und mit dessen eigenem Cache zu verschmelzen. Der Empfänger kann danach weiter dekodieren, als wäre der benötigte Kontext bereits in seinem internen Zustand enthalten.

Zunächst führen beide Modelle ein Prefill auf gemeinsamem Kontext aus und erzeugen ihre eigenen KV-Caches. Anschließend projiziert ein trainierbarer Fuser ausgewählte Quellzustände schichtweise in die entsprechenden Schichten des Empfängers; eine residuale Fusion ergänzt die übertragene Semantik, und ein trainierbares Gate entscheidet, welche Schichten überhaupt verändert werden sollen. Das ist ein wichtiger Punkt: Eine grobe Injektion in alle Schichten wäre eher ein Weg, Repräsentationen zu beschädigen, als ein Kommunikationsprotokoll.

Oracle-Experimente zeigten, dass sich die Semantik eines KV-Caches anreichern lässt, ohne seine Größe zu erhöhen. Zum Veröffentlichungszeitpunkt berichteten die Autoren über durchschnittliche Genauigkeitsgewinne von 6,4 bis 14,2 Prozentpunkten gegenüber einzelnen Modellen und von 3,1 bis 5,4 Punkten gegenüber der Übertragung per Text. Die Idee wird also nicht nur durch ansprechende Visualisierungen verborgener Zustände, sondern auch durch Aufgabenresultate gestützt.

Die Arbeit trägt das Datum Oktober 2025 und sollte daher eher als Forschungsrichtung denn als aktuelle Tagesmeldung gelesen werden. Das offizielle Implementierungs-Repository macht C2C konkreter als ein bloßes Konzept, verwandelt es aber nicht in ein universelles Protokoll.

Was sich für Multi-Agenten-Systeme ändert

Der praktische Vorteil liegt auf der Hand: Modelle müssen ihren Arbeitszustand nicht mehr in Text verpacken, den ein anderes Modell anschließend erneut interpretieren muss. Das kann Tokenverbrauch und die Latenz eines textbasierten Handoffs senken und zugleich Semantik erhalten, die eine gewöhnliche Nachricht verlieren könnte.

Am stärksten profitieren vorab zusammengestellte Modellkombinationen mit Zugriff auf interne Caches. Die Kehrseite ist die eingeschränkte Universalität: C2C hängt von einem trainierten Projektor, einer Schichtausrichtung und kompatiblen Schnittstellen ab. Ein Adapter für ein beliebiges Modellpaar entsteht nicht automatisch.

Meine zentrale Frage betrifft nicht die Genauigkeit, sondern die Steuerbarkeit. Textaustausch lässt sich einfach protokollieren und prüfen, während ein fusionierter KV-Cache ein undurchsichtiger interner Zustand bleibt. Die entscheidende Frage ist nun nicht, ob ein Cache Bedeutung transportieren kann, sondern wie viele Modellpaare erneut lernen müssen, einander zu verstehen.

Zuvor haben wir untersucht, wie Claude-Opus-4.6-Konfigurationen und Kontextkosten die Architektur von LLM-Systemen prägen. C2C führt diesen Gedanken weiter und schlägt vor, bereits berechnete KV-Cache-Zustände direkt zwischen Modellen zu übertragen.