2 мин чтения

C2C передает смысл между LLM через KV-кеш

Cache-to-CacheKV-кешмультиагентные системы

Cache-to-Cache предлагает передавать смысл между LLM без промежуточного текста: KV-кеш одной модели проецируется во внутреннее пространство другой и сливается с ее кешем. Авторы сообщают о росте точности, однако практический подход по-прежнему требует обученного преобразователя для каждой конкретной пары моделей.

Что именно передает Cache-to-Cache

Меня здесь цепляет главное: C2C передает смысл между LLM без промежуточной текстовой реплики. В статье Cache-to-Cache на arXiv авторы предлагают взять KV-кеш модели-источника, нейросетью перевести его в пространство модели-получателя и слить с ее собственным кешем. Получатель после этого продолжает декодирование, будто нужный контекст уже встроен в его внутреннее состояние.

Сначала обе модели проходят prefill на общем контексте и строят собственные KV-кеши. Затем обучаемый fuser послойно проецирует выбранные состояния источника в соответствующие слои получателя; остаточное слияние добавляет переносимую семантику, а обучаемый gate решает, какие слои вообще стоит трогать. Это важная деталь: грубая инъекция во все слои скорее выглядела бы как способ испортить представления, чем как протокол связи.

Оракульные эксперименты показали, что семантику KV-кеша можно обогащать без увеличения его размера. На момент публикации авторы сообщали о приросте средней точности от 6,4 до 14,2 процентного пункта относительно отдельных моделей и от 3,1 до 5,4 пункта относительно передачи через текст. То есть идея проверяется не только красивой визуализацией скрытых состояний, но и результатом на задачах.

Работа датирована октябрем 2025 года, поэтому сейчас ее разумнее читать как направление, а не как новость дня. Официальный репозиторий с реализацией делает C2C конкретнее обычного концепта, но не превращает его в универсальный протокол.

Что меняется для мультиагентных систем

Практический выигрыш понятен: модели больше не обязаны упаковывать рабочее состояние в текст, а затем заново разбирать эту упаковку. Это сокращает расход токенов и задержку текстового handoff, одновременно сохраняя семантику, которую обычное сообщение могло бы потерять.

Больше всего выигрывают заранее собранные связки моделей с доступом к внутренним кешам. Универсальность, наоборот, страдает: C2C зависит от обученного проектора, согласования слоев и совместимых интерфейсов. Для произвольной пары моделей такой переходник не возникает автоматически.

Мой главный вопрос касается не точности, а управляемости. Текстовый обмен легко записать и проверить, тогда как слитый KV-кеш остается непрозрачным внутренним состоянием. Главная интрига теперь не в том, умеет ли кеш переносить смысл, а в том, сколько пар моделей придется учить понимать друг друга заново.

Ранее мы разбирали, как конфигурации Claude Opus 4.6 и стоимость контекста влияют на архитектуру LLM-систем. C2C развивает эту тему, предлагая передавать уже вычисленное состояние KV-кеша между моделями напрямую.