面向突发 LLM 推理的预测推测式 KV 复制

一项针对 LLM 推理系统的新优化思路——用“预测+推测”的方式提前复制 KV 缓存,目标是降低突发流量下推理服务的延迟抖动,属于 AI 基础设施层的技术探索。

一项针对 LLM 推理系统的新优化思路——用“预测+推测”的方式提前复制 KV 缓存,目标是降低突发流量下推理服务的延迟抖动,属于 AI 基础设施层的技术探索。

Uber 在 92% 工程师采用 AI 编程后,AI 相关成本六个月增长六倍、单人月成本一度达 2,000 美元,已开始将每名开发者的 AI 使用额度控制在 1,500 美元以内,并转向更精细化的 AI 投入产出评估。

2026年7月30日,人工智能产品应用博览会(智博会)在江苏苏州开幕,主题为“一元复始 万象AI”。这场展会的看点不在发布某款具体产品,而在明确提出“苏州工业场景+上海创新资源”双城协同的模式,并首次将Token经济列为独立议题——这是AI行业从技术展示转向商业化落地的一个信号。

前 OpenAI 员工 Josh Meyer 创立的 AI 制药公司 Chai,正把药物设计周期从数年压缩到 24 小时计算加几周实验室验证,最新模型 Chai 3 的抗体设计成功率已从一年前的约 0.1% 提升到接近 30%。这不是实验室里的概念演示,而是已经通过礼来压力测试、正在进入真实药物研发管线的技术…

据 The Information 报道,OpenAI 本周向美国政策制定者与监管机构闭门演示了新一代 “Astra” 模型家族,重点展示其完成长时段复杂任务的能力。这次演示的意义在于,AI 竞争正从“对话能力”转向“代理式执行”,且 OpenAI 正主动将监管沟通前置。

JWLabs 团队在 Hacker News 发布了一项面向突发式 LLM 推理的优化技术,通过“预测推测式 KV 复制”提前准备缓存,试图在流量高峰到来时降低推理延迟。这为 AI 推理服务降低成本提供了新思路。

围绕 AI“推理能力”的争论进入了一个矛盾阶段:大型推理模型(LRM)既在数学竞赛和科研问题上拿出惊人成绩,又被研究发现大量解题过程依赖表面捷径而非真正推理。结论是:AI 推理确实有效,但“有效不等于可解释”,其底层机制至今没有科学定论。

一台搭载高通 AI 芯片的人形机器人在发布会上当众倒地,而搭载 DeepMind Gemini Robotics 2 的 Apollo 机器人却能自主完成从未训练过的系垃圾袋任务。两段视频对比揭示了人形机器人的真实差距,也指向可行的技术路线:用统一“大脑”替代分散控制与预编程。

AI 批评者 Ed Zitron 在接受 MacRumors 采访时提出,如果当前由巨额算力投资支撑的 AI 泡沫破裂,苹果可能会成为受影响最小的科技巨头,甚至选择在行业动荡期“袖手旁观”,通过低价收购或维持现状来坐享其成。

Hacker News 上关于“AI 泡沫何时破裂”的讨论,意外地将苹果推到了中心:相比微软、谷歌和英伟达,苹果没有把赌注全押在云端 AI 上,而是凭借自研芯片和统一内存架构,在本地运行大模型这条路上握有独特筹码。若 AI 资本热潮退潮,苹果可能反而是受伤最轻、甚至能“看着一切燃烧”的那个。