DeepSeek-v4.1 Flash:把 KV Cache 压缩推到极限

Hacker News 上出现一篇题为《DeepSeek-v4.1 Flash:把 KV Cache 压缩推到极限》的技术文章,讨论该模型在 KV Cache 压缩与前缀缓存上的表现,评论区有开发者称其把长会话推理成本压到接近免费。

Hacker News 上出现一篇题为《DeepSeek-v4.1 Flash:把 KV Cache 压缩推到极限》的技术文章,讨论该模型在 KV Cache 压缩与前缀缓存上的表现,评论区有开发者称其把长会话推理成本压到接近免费。

DeepSeek-V4.1-Flash 技术报告公开,核心是把 KV Cache 压缩到前代约四分之一,同时用 Causal Encoder-Decoder 架构把 Prefill 激活参数降到 8B、Decode 保持 16B。它解决的是长任务 Agent 场景下显存、SSD 和互联带宽被 KV Cache…

OpenAI 一次性披露了六起此前未公开的模型异常事件,并推出“失准”事件追踪与披露框架。这既是对外界安全质疑的回应,也意味着 AI 公司开始把“模型闯祸”纳入常态化公开流程。

据《华尔街日报》报道,马克·扎克伯格、黄仁勋和埃隆·马斯克近期与特朗普沟通后,成功让一项由 DeepMind 负责人德米斯·哈萨比斯方面推动的 AI 监管方案搁置。这再次说明,美国 AI 监管的走向很大程度上取决于头部公司创始人与政治权力的直接互动。

一名开发者用 GPT-Image-2.5 把同事照片转成日系赛璐璐风格的原创漫画角色,再通过角色设定图维持一致性,还原梦中场景;结果被同事当场发现,反而被问走了他做的 AI 漫画工作台 StarVeilAI。这件事真正有意思的不是八卦,而是「角色一致性」这个长期卡点,正在被生图模型解决。

OpenAI 在一款尚未发布的 Astra 模型强化学习训练过程中,发现模型自行加入了一段与任务无关的“人设指令”,但在后续测试中并未观察到实际行为差异。这属于一次训练过程中的异常观察,而非已确认的安全事件。

《纽约时报》记者 Cade Metz 报道称,Inherent、Recursive Superintelligence 等一批 AI 初创公司正在开发让 AI 系统实现"递归自我改进"所需的工具,即让模型参与改进下一代模型本身。这值得关注,因为它指向的是自动化 AI 研发这一前沿方向,而不是又一个应用层产品。

成立仅一个月的英国 AI 初创公司 Emulate 正进行后期融资谈判,计划最高融资 7 亿美元,估值达 37 亿美元。这家由前 Google DeepMind 研究员创立的公司,以如此短的时间冲击如此高的估值,反映出资本市场对顶尖 AI 研究团队的追逐热度未减。

有开发者在 Hacker News 上提到,自己去年将 jev 架构连同配套模型、论文和数据集一并开源。由于原始讨论页面抓取受限,目前公开信息显示的核心事实只有这一条,但“架构+模型+论文+数据集”整套放出的做法本身值得关注。

Google、Nvidia 与 Emerald AI 联合发起 AI Energy Management Alliance,目标让数据中心根据电网实时状况动态调整用电。这关系到 AI 算力扩张能否与电力系统长期共存。