多大型语言模型(LLM)系统旨在通过互补优势,突破单一模型的性能与效率瓶颈。然而,现有架构依赖文本作为通信媒介,强制将内部表征转换为词元序列。这一过程不仅造成丰富语义信息的丢失,还因逐词生成引入了显著延迟。

针对上述局限,研究团队提出“Cache-to-Cache”(C2C)新范式,探索LLM间超越文本的直接语义通信。基于预言机实验发现——丰富的KV缓存语义可在不增加存储负担的前提下提升响应质量,C2C确立以KV缓存为高效通信介质。

技术原理:KV缓存的直接投影与融合

C2C通过神经网络将源模型的KV缓存投影并融合至目标模型,实现语义的直接传输。系统引入一种可学习的门控机制,动态筛选能从缓存通信中获益的目标层。相较于传统文本交互,该方案充分利用了双模型的深层专用语义,并彻底规避了显式中间文本生成的开销。

性能表现:准确率显著提升,延迟减半

实验数据显示,C2C的平均准确率较单个模型提升6.4%至14.2%。在与文本通信范式的对比中,C2C不仅将准确率进一步推高3.1%至5.4%,更将平均延迟降低至原来的1/2.5,实现2.5倍的加速效果。目前,相关代码已开源。