一句话看懂:清华大学团队提出 Cache-to-Cache(C2C)技术,让两个大模型直接交换内部缓存信息,跳过”把想法写成文字再传给对方”的环节。论文已被 ICLR 2026 接收,并附带开源代码。
事件核心:发生了什么
多个大模型协作时,通常由前一个模型生成文本,后一个模型再读取。这个”打字”过程既消耗算力,也会丢失前者推理过程中的细节信息。C2C 的做法是:把第一个模型的缓存(即它处理过的内容的工作记忆)直接传给第二个模型的记忆区,中间由一个名为 Fuser 的小模块负责重整数据格式,让接收方能够使用。
由于不同模型的内部结构、尺寸和布局差异很大,直接搬运缓存会让模型输出崩溃。C2C 因此加入选择性门控机制:部分网络层立即吸收外部信息,其他层继续独立推理,不受干扰。研究团队报告称,在协作任务中推理速度提升 100% 至 150%,最高约为传统文本往返方式的 2.5 倍;协作准确率提升最高 14.2%,相比文字通信的旧方案高出 3.1% 至 5.4%。
为什么重要
当前 AI 应用的多模型编排(如一个模型检索、一个模型总结、一个模型生成)几乎都靠文本串联,文本成了隐性的性能瓶颈。C2C 把通信层从”语言”下沉到”缓存”,等于绕开了人类语言这个中间格式。如果这类方法被主流推理框架采纳,多模型流水线的延迟和成本结构可能被重写。
但需要注意两点:其一,该方法要求直接访问模型的内部缓存和层结构,目前只适用于开放权重模型,闭源 API 无法使用;其二,论文中的全部性能数据由提出该方法的团队自己测试得出,外部复现结果尚待观察。
对用户/开发者/创作者的影响
对使用闭源聊天产品的普通用户,短期没有直接影响。对开发者和企业来说,价值更明确:如果你在自建推理服务、使用 Llama、Qwen 等开源权重模型搭建多智能体或级联流程,C2C 提供了一条减少 token 消耗、压缩延迟的路径,且已开源可试。对做 RAG、Agent 编排的团队,这意味着一部分原本靠 prompt 传递的中间结果,可能改为缓存级传递,工程实现方式会变化。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
模型厂商则面临一个选择:继续用闭源 API 把内部缓存锁在自己手里,还是开放更底层的模型间通信接口。目前公开信息显示,还没有公司确认已在内部使用类似方案。
值得关注的后续
一是开源社区是否在主流推理框架(如 vLLM、SGLang)中复现并验证其速度与准确率数据;二是该方法能否扩展到异构模型组合,以及是否会产生新的对齐、安全与可解释性问题——缓存里传递的内容人类无法直接阅读;三是闭源厂商是否会推出自己的”模型间直连”能力,把这一层重新收进商业 API。
来源:TechRadar


