标签: ChatGPT

缓存到缓存:LLM 间的直接语义通信(2025)

缓存到缓存:LLM 间的直接语义通信(2025)

Hacker News 上有人提出,如果不同大模型的 KV 缓存可以互相理解,就能让模型之间直接“传缓存”通信,省掉重复预填充和交接延迟。帖子引用了 Ramp Labs 的相关讨论,但目前公开信息显示,这仍是一个概念设想,而非已落地的产品。