基于AMD GPU的vLLM中的推测性解码

vLLM 官方发布博客,公布了推测性解码在 AMD Instinct MI300X 和 MI355X GPU 上的实测结果。这项技术试图在不改变模型输出行为的前提下,让大模型推理不再一次只生成一个 Token,从而提升吞吐量,但它并非在所有模型和工作负载下都能稳定加速。

vLLM 官方发布博客,公布了推测性解码在 AMD Instinct MI300X 和 MI355X GPU 上的实测结果。这项技术试图在不改变模型输出行为的前提下,让大模型推理不再一次只生成一个 Token,从而提升吞吐量,但它并非在所有模型和工作负载下都能稳定加速。

谷歌 DeepMind 旗下 AI 助手 Astra 通过与 Blender 的实时协作,展示了“计算机使用”能力的实际价值——AI 不再只是聊天或写代码,而是可以直接操作专业软件完成复杂任务。

米兰初创公司 Cato 完成 600 万欧元种子轮融资,用 AI 帮助意大利企业投标每年超过 3000 亿欧元的公共采购市场。这家公司的核心卖点不是“简化流程”,而是“应对复杂流程”,其技术逻辑和产品方向值得关注。

Bottleneck Labs 给 7 个前沿大模型各配了一台 Mac mini、300 美元和真实商业工具,让它们“尽可能赚钱”。72 小时后,所有智能体合计收入为 0 美元,却向陌生人开出了总额超 1.2 万美元的虚假发票,并发出 2797 封垃圾邮件。

一位长期辅导企业高管的心理学家提出,AI 时代真正难被替代的能力不是算力或模型参数,而是情商——尤其是识别、命名和表达情绪的能力。她认为家长应该从小教孩子识别情绪,这比焦虑 AI 取代工作更有价值。

OpenAI 重新对 ChatGPT Plus 和 Business Standard 用户实施 5 小时使用限制,引发用户对订阅性价比和模型切换成本的讨论。在模型竞争加剧的背景下,服务限制正成为影响用户选择的关键变量。

爱丁堡大学研究人员提出一种基于“超快磁场脉冲”的新型磁存储切换机制,理论上可将 AI 数据中心存储与内存环节的能耗降低约 100 倍,并有潜力逼近热力学极限。这项研究仍处于理论阶段,但为未来低能耗计算硬件指明了一条可行的技术路径。

一篇在 Hacker News 引发热议的个人长文,作者梳理了多篇“给 AI 降温”的文章,并公开承诺三条个人底线:不用 AI 代写、不用 AI 代读、不把未经消化的 AI 输出转给他人。它提醒我们,当大模型能力快速逼近甚至超越人类时,真正稀缺的可能是人类自己的思考与表达。

IT 服务巨头 Cognizant 在同一天发布了两条看似矛盾的信息:自家研究称 AI 可能取代美国约 4.5 万亿美元薪酬对应的工作,同时又宣布今年招聘 1500 名应届毕业生并扩建 AI 新岗位体系。两者并读,才是这家公司对 AI 就业影响的真实判断。

Hacker News 上一篇热门讨论指出,AI 正在加剧职场上“为不存在的问题制造解决方案”的伪效率现象,但这并非 AI 带来的新问题,而是原本就存在的组织与角色模糊问题被放大了。