2 хв читання

C2C передає зміст між LLM через KV-кеш

Cache-to-CacheKV-кешмультиагентные системы

Cache-to-Cache передає зміст між LLM без проміжного текстового повідомлення. KV-кеш однієї моделі проєктується у внутрішній простір іншої та зливається з її кешем. Автори повідомляють про приріст точності, але практичне застосування все ще потребує навченого адаптера для кожної пари моделей.

Що саме передає Cache-to-Cache

Найцікавіше тут те, що C2C передає зміст між LLM без проміжної текстової репліки. У статті Cache-to-Cache на arXiv автори пропонують узяти KV-кеш моделі-джерела, за допомогою нейромережі перевести його в простір моделі-одержувача та злити з її власним кешем. Після цього одержувач продовжує декодування так, ніби потрібний контекст уже вбудований у його внутрішній стан.

Спочатку обидві моделі проходять prefill на спільному контексті та формують власні KV-кеші. Потім навчуваний fuser пошарово проєктує вибрані стани джерела у відповідні шари одержувача; залишкове злиття додає передану семантику, а навчуваний gate визначає, які шари взагалі варто змінювати. Це важлива деталь: груба ін'єкція в усі шари радше зіпсувала б представлення, ніж стала протоколом зв'язку.

Оракульні експерименти показали, що семантику KV-кешу можна збагачувати без збільшення його розміру. На момент публікації автори повідомляли про зростання середньої точності на 6,4–14,2 відсоткового пункта порівняно з окремими моделями та на 3,1–5,4 пункта порівняно з передаванням через текст. Тобто ідея підтверджується не лише красивими візуалізаціями прихованих станів, а й результатами на завданнях.

Роботу датовано жовтнем 2025 року, тому зараз її варто читати радше як перспективний напрям, а не як новину дня. Офіційний репозиторій з реалізацією робить C2C конкретнішим за звичайну концепцію, але не перетворює його на універсальний протокол.

Що змінюється для мультиагентних систем

Практична вигода зрозуміла: моделям більше не потрібно пакувати робочий стан у текст, а іншій моделі — знову розбирати це пакування. Це може скоротити витрати токенів і затримку текстового handoff, водночас зберігаючи семантику, яку звичайне повідомлення могло б втратити.

Найбільше виграють заздалегідь зібрані зв'язки моделей із доступом до внутрішніх кешів. Натомість страждає універсальність: C2C залежить від навченого проєктора, узгодження шарів і сумісних інтерфейсів. Перехідник для довільної пари моделей не виникає автоматично.

Моє головне питання стосується не точності, а керованості. Текстовий обмін легко записати та перевірити, тоді як злитий KV-кеш залишається непрозорим внутрішнім станом. Тепер головна інтрига не в тому, чи здатен кеш переносити зміст, а в тому, скільки пар моделей доведеться заново навчати розуміти одна одну.

Раніше ми розглядали, як конфігурації Claude Opus 4.6 і вартість контексту впливають на архітектуру LLM-систем. C2C розвиває цю тему, пропонуючи напряму передавати між моделями вже обчислений стан KV-кешу.