KV、前缀、提示词与语义缓存:LLM 中四类缓存的清晰解析

KV 缓存、前缀缓存、提示词缓存和语义缓存,这四类机制共同决定了 LLM 推理的速度和成本,但它们各自存储的对象、匹配方式和风险完全不同。理解这四者的区别,是判断 API 定价和优化应用延迟的关键。

KV 缓存、前缀缓存、提示词缓存和语义缓存,这四类机制共同决定了 LLM 推理的速度和成本,但它们各自存储的对象、匹配方式和风险完全不同。理解这四者的区别,是判断 API 定价和优化应用延迟的关键。

一篇面向非技术用户的 Codex 实操教程在社区流传,它把 AI 编程助手的使用场景从“写代码”扩展到了电脑配置、文件夹整理等日常任务,说明 AI 工具正在从开发者专属走向普通办公人群。

GitHub 上出现一套名为 AI Engineer Notebooks 的免费教程项目,用零框架、零成本的方式系统训练 AI 工程师技能,涵盖 RAG、智能体、评估等核心环节,并配有可在 Colab 上直接运行的代码。

斯坦福大学团队联合多学科专家发布 Terminal-Bench-Science 0.1,用 70 个真实科研工作流测试 AI 智能体。目前最强模型 Claude Opus 5 的解决率只有 30%,说明 AI 离真正走进科研一线仍有明显距离。

Google 推出专用于语音转文字的模型 Gemini 3.5 Transcribe,主打高精度、低成本和原生结构化输出,开发者无需再用通用大模型加复杂提示词来“凑”转录结果。这个轻量级专用模型,可能改变音视频内容处理的工作流。

蚂蚁集团与中金公司合作推出首个金融增强大模型 Ling-3.0-flash-Fin,在通用模型基础上强化了投研与信息检索能力,并计划开源权重与配套基准测试集,金融垂直大模型的竞争正式进入“专业能力+开源生态”阶段。

腾讯混元于8月28日发布开源旗舰大模型Hy4preview,总参数770B、激活参数49B,支持1M上下文,并在软件工程、办公、游戏与科研等真实生产力场景中展示了具体能力,值得开发者重点关注。

微博官方于 8 月 28 日证实,流传的孙宇晨与谷爱凌聊天记录为 AI 生成的虚假内容,造谣账号已被永久关闭。此事暴露了利用 AI 生成虚假信息、配合买热搜进行恶意营销的黑产链路已进入公众视野。

Anthropic 正式发布面向硬件设备的 MHS(Model Hardware Standard)标准,让大模型驱动的 AI 智能体能安全操控实体设备。它把硬件集成时间从数周甚至数月压缩到几小时,是 AI 从数字世界走向物理世界的关键基础设施。

Anthropic 于 8 月 27 日发布“模型硬件标准”(MHS)研究预览,让 AI 智能体直接控制显微镜、机械臂等物理设备。这是 Anthropic 首次公开布局具身智能与物理 AI,意味着大模型竞争正从“会聊天”延伸到“会干活”。