持久状态机:LLM Attention 与 INT4 内存单元

一篇题为“持久状态机:LLM Attention 与 INT4 内存单元”的研究在 Hacker News 引发讨论,它试图用 INT4 低精度内存单元改造大语言模型的 Attention 状态持久化方式,指向更省显存、更低成本的推理硬件方案。

一篇题为“持久状态机:LLM Attention 与 INT4 内存单元”的研究在 Hacker News 引发讨论,它试图用 INT4 低精度内存单元改造大语言模型的 Attention 状态持久化方式,指向更省显存、更低成本的推理硬件方案。

一个开源教程用不到100行代码,在单张8GB显存GPU上跑通了SFT、DPO、GRPO三大后训练流程,并复现了“强化学习比监督微调遗忘更少”的行业关键结论,把大模型后训练的门槛拉到了个人开发者够得着的水平。

巴菲特罕见公开表态,认为科技巨头在AI基础设施上的巨额资本开支可与19世纪美国铁路建设相提并论,并因此看多Alphabet。这说明最谨慎的传统投资人开始把AI算力投入视为长期价值投资,而非短期泡沫。

宇树科技(Unitree)正式发布四轮无人地面载具 AS2-W,重 25kg、可爬 45° 斜坡并搭载 150 TOPS 算力的机载 AI 模块;由于解放军此前在中蒙联合演习中被发现使用类似平台,这款产品的民用发布与军事应用的时间点值得关注。

一段标题为“关于人工智能‘每个人都被骗了’”的视频在 Hacker News 社区引发讨论,其核心观点指向大众对 AI 能力的系统性误判,折射出行业正从“能力宣传期”进入“落地验证期”。

MarkTechPost 近期发布技术解读,聚焦 NVIDIA Transformer Engine、融合内核和 BF16/FP8 低精度格式如何加速 Transformer 训练。对于使用 GPU 训练大模型的团队来说,这类优化直接关系到训练成本和效率的改善。

X 用户 @MaxForAI 发文称,当前全球大部分大模型已进入 DeepSeek 的“斩杀区”——能力不如 DeepSeek、价格却更贵的模型会被逐步淘汰。帖子引发大量讨论,核心争议是 DeepSeek 是否真的足以改变市场格局。

微软 AI 负责人 Sebastien Bubeck 透露,下一代大模型 Astra 已能独立构造数学证明,并附带可验证的 Lean 证书。这件事值得关注,因为它让“AI 会推理”第一次有了可审计的硬核证据,而不仅仅是对话层面的“看起来聪明”。

OpenAI CEO Sam Altman 在 X 上提议,父母可以用 ChatGPT 连接家庭日历、结合孩子兴趣,每天自动生成一段播客来“了解孩子”,结果引发大规模批评——回复“你为什么不直接和你的孩子聊聊”获得了 12 万点赞。

纽约时报援引 Epoch AI 的预测指出,未来几年将有一大批 AI 算力陆续上线,全球在用的 AI 芯片数量预计每九个月翻一番。算力供给的快速膨胀,正在成为影响大模型训练成本、产品定价和产业竞争格局的关键变量。