C2C передает смысл между LLM через KV-кеш
Cache-to-CacheKV-кешмультиагентные системы
Что именно передает Cache-to-Cache
Меня здесь цепляет главное: C2C передает смысл между LLM без промежуточной текстовой реплики. В статье Cache-to-Cache на arXiv авторы предлагают взять KV-кеш модели-источника, нейросетью перевести его в пространство модели-получателя и слить с ее собственным кешем. Получатель после этого продолжает декодирование, будто нужный контекст уже встроен в его внутреннее состояние.
Сначала обе модели проходят prefill на общем контексте и строят собственные KV-кеши. Затем обучаемый fuser послойно проецирует выбранные состояния источника в соответствующие слои получателя; остаточное слияние добавляет переносимую семантику, а обучаемый gate решает, какие слои вообще стоит трогать. Это важная деталь: грубая инъекция во все слои скорее выглядела бы как способ испортить представления, чем как протокол связи.
Оракульные эксперименты показали, что семантику KV-кеша можно обогащать без увеличения его размера. На момент публикации авторы сообщали о приросте средней точности от 6,4 до 14,2 процентного пункта относительно отдельных моделей и от 3,1 до 5,4 пункта относительно передачи через текст. То есть идея проверяется не только красивой визуализацией скрытых состояний, но и результатом на задачах.
Работа датирована октябрем 2025 года, поэтому сейчас ее разумнее читать как направление, а не как новость дня. Официальный репозиторий с реализацией делает C2C конкретнее обычного концепта, но не превращает его в универсальный протокол.
Что меняется для мультиагентных систем
Практический выигрыш понятен: модели больше не обязаны упаковывать рабочее состояние в текст, а затем заново разбирать эту упаковку. Это сокращает расход токенов и задержку текстового handoff, одновременно сохраняя семантику, которую обычное сообщение могло бы потерять.
Больше всего выигрывают заранее собранные связки моделей с доступом к внутренним кешам. Универсальность, наоборот, страдает: C2C зависит от обученного проектора, согласования слоев и совместимых интерфейсов. Для произвольной пары моделей такой переходник не возникает автоматически.
Мой главный вопрос касается не точности, а управляемости. Текстовый обмен легко записать и проверить, тогда как слитый KV-кеш остается непрозрачным внутренним состоянием. Главная интрига теперь не в том, умеет ли кеш переносить смысл, а в том, сколько пар моделей придется учить понимать друг друга заново.