C2C передає зміст між LLM через KV-кеш
Cache-to-CacheKV-кешмультиагентные системы
Що саме передає Cache-to-Cache
Найцікавіше тут те, що C2C передає зміст між LLM без проміжної текстової репліки. У статті Cache-to-Cache на arXiv автори пропонують узяти KV-кеш моделі-джерела, за допомогою нейромережі перевести його в простір моделі-одержувача та злити з її власним кешем. Після цього одержувач продовжує декодування так, ніби потрібний контекст уже вбудований у його внутрішній стан.
Спочатку обидві моделі проходять prefill на спільному контексті та формують власні KV-кеші. Потім навчуваний fuser пошарово проєктує вибрані стани джерела у відповідні шари одержувача; залишкове злиття додає передану семантику, а навчуваний gate визначає, які шари взагалі варто змінювати. Це важлива деталь: груба ін'єкція в усі шари радше зіпсувала б представлення, ніж стала протоколом зв'язку.
Оракульні експерименти показали, що семантику KV-кешу можна збагачувати без збільшення його розміру. На момент публікації автори повідомляли про зростання середньої точності на 6,4–14,2 відсоткового пункта порівняно з окремими моделями та на 3,1–5,4 пункта порівняно з передаванням через текст. Тобто ідея підтверджується не лише красивими візуалізаціями прихованих станів, а й результатами на завданнях.
Роботу датовано жовтнем 2025 року, тому зараз її варто читати радше як перспективний напрям, а не як новину дня. Офіційний репозиторій з реалізацією робить C2C конкретнішим за звичайну концепцію, але не перетворює його на універсальний протокол.
Що змінюється для мультиагентних систем
Практична вигода зрозуміла: моделям більше не потрібно пакувати робочий стан у текст, а іншій моделі — знову розбирати це пакування. Це може скоротити витрати токенів і затримку текстового handoff, водночас зберігаючи семантику, яку звичайне повідомлення могло б втратити.
Найбільше виграють заздалегідь зібрані зв'язки моделей із доступом до внутрішніх кешів. Натомість страждає універсальність: C2C залежить від навченого проєктора, узгодження шарів і сумісних інтерфейсів. Перехідник для довільної пари моделей не виникає автоматично.
Моє головне питання стосується не точності, а керованості. Текстовий обмін легко записати та перевірити, тоді як злитий KV-кеш залишається непрозорим внутрішнім станом. Тепер головна інтрига не в тому, чи здатен кеш переносити зміст, а в тому, скільки пар моделей доведеться заново навчати розуміти одна одну.