缓存到缓存:LLM 间的直接语义通信(2025)

一篇发表在 ICLR'26 的论文提出 Cache-to-Cache(C2C),让多个大模型不再靠输出文字互相"对话",而是直接在 KV-Cache 层面传递语义,平均准确率比文本通信高约 3.1–5.4%,延迟快约 2.5 倍。

一句话看懂:一篇发表在 ICLR’26 的论文提出 Cache-to-Cache(C2C),让多个大模型不再靠输出文字互相”对话”,而是直接在 KV-Cache 层面传递语义,平均准确率比文本通信高约 3.1–5.4%,延迟快约 2.5 倍。

事件核心:发生了什么

这篇论文于 2025 年 10 月 3 日提交到 arXiv(编号 2510.03215),2026 年 3 月 2 日更新至 v2,作者包括 Tianyu Fu、Zihan Min、Hanling Zhang、Jichao Yan、Guohao Dai、Wanli Ouyang、Yu Wang,已被 ICLR’26 收录。

现有多模型协作系统的做法是”文字接力”:一个模型把内部表示转成输出 token 序列,另一个模型再重新读一遍。论文指出这个过程既丢掉了 KV-Cache 里更丰富的语义,也要承受逐 token 生成的延迟。作者先用”Oracle 实验”验证:在不增加缓存体积的前提下,增强 KV-Cache 语义就能提升回答质量。

于是他们设计了 C2C:用一个神经网络把源模型的 KV-Cache 投影、融合进目标模型的对应缓存,并通过可学习的门控机制挑选哪些层真正受益于这种跨模型通信,从而跳过显式的中间文本生成。

为什么重要

多模型协作(大模型路由、混合专家式调度、模型级联)已是主流工程手段,但通信方式一直停留在”文本协议”上,代价是信息损失和串行延迟。C2C 把通信层下移到缓存层,等于给多模型系统换了一套内部总线。

数据上,C2C 比单个模型平均准确率高 6.4–14.2%,比文本通信范式高约 3.1–5.4%,延迟平均快 2.5 倍。如果这类方法被产品化,直接影响的是推理成本结构和多模型编排框架的设计思路,而不只是单点精度提升。目前公开信息显示,这些结论来自论文的实验设置,尚未见大规模生产验证。

对用户/开发者/创作者的影响

对开发者而言,最直接的价值是”编排层”可能出现新抽象:过去用 API 串起多个模型要靠提示词和文本中转,未来推理框架或推理引擎可能暴露缓存级接口。但这要求模型之间在层结构、隐藏维度上具备一定可比性,异构模型混用仍是难点。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对做 AI 应用和内容工具的团队,2.5 倍延迟改善意味着实时场景(对话、Agent 循环、代码补全)的响应体验有优化空间;准确率提升则可能减少多模型投票、重试等补救手段。对企业采购与算力规划,缓存级通信对显存和带宽的要求与文本通信不同,选型时值得关注实际显存占用数据,而不是只看论文里的延迟数字。

值得关注的后续

一是开源代码的实际可用程度:能否在主流开源模型(如 Llama、Qwen 系列)上直接跑通,还是需要配套训练门控网络。二是推理框架是否跟进,比如 vLLM、SGLang 这类引擎会不会支持跨实例缓存传递。三是异构模型组合的泛化能力,以及是否存在缓存被注入异常语义的安全面。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 24380

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注