突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

LMSYS(Chatbot Arena 团队)发布了对 DeepSeek-V4-Pro 在 H20 上的推理优化方法,通过多场景 serving profile 设计,让这款 1.6 万亿参数的 MoE 模型在显存和带宽受限的硬件上,仍能达到接近 B300 的延迟表现。

LMSYS(Chatbot Arena 团队)发布了对 DeepSeek-V4-Pro 在 H20 上的推理优化方法,通过多场景 serving profile 设计,让这款 1.6 万亿参数的 MoE 模型在显存和带宽受限的硬件上,仍能达到接近 B300 的延迟表现。

一条在 X 平台获得超 8 万次浏览的帖子指出,当前经济压力下,大量具备技术背景的失业人员流向海外灰产,而真正获利的是为灰产提供 AI 建号、支付通道和流量分发等配套服务的产业链,最终利润仍被权力环节抽成。

Kubernetes 官方生态开发者用 10 万行代码在浏览器里模拟真实集群,直观展示了 Startup、Readiness、Liveness 三类探针的工作原理与常见误区。这件事的价值在于:它把复杂的容器编排调试过程可视化,帮助开发者真正理解探针机制,减少误配置导致的线上故障。

Hacker News 上围绕“人工智能时代的数学”展开讨论,核心争议是:当定理证明复杂到无人能完全理解、只能靠 Lean 等形式化验证确认正确时,我们是否还应该接受它并继续在其上搭建新成果。

初创公司 Silicon Data 完成 3000 万美元 A 轮融资,试图为 GPU 租赁市场建立像股票指数一样的参考价格,并计划在芝加哥商品交易所(CME)推出算力期货合约。这件事意味着 AI 算力这个巨大的支出项,正在从“按小时租服务器”变成一种可以被定价、对冲和交易的金融资产。

开源工具 Unsloth 从“微调专用”扩展为覆盖推理、训练、导出的一体化本地 AI 工作台,让企业和个人开发者可以用同一套工具完成模型运行与定制,目前在 GitHub 已获超 7.3 万 Star。

本期精选的5篇AI论文覆盖智能体可靠性、开放权重安全、长上下文效率、真实场景评测与测试时自我改进。其中关于自改进智能体脆弱性的研究直接挑战了当前主流评估方式,对依赖AI智能体的开发者和企业有明确警示意义。

NVIDIA 发布 Cosmos 3 Edge,一个 4B 参数的世界模型,经过后训练可直接部署在 Jetson Thor 机器人上实时推理,让机器人不再依赖数据中心 GPU,实现真正的设备端控制。

一个名为 microGPT-C 的开源项目用纯 C 语言、零依赖实现了一个字符级 GPT 训练与推理,在 Apple M5 Pro 上跑出了超过 1000 万 token/秒的推理速度,展示了极简实现配合现代 ARM 指令集能压榨出的惊人算力效率。

有开发者使用纯 C 语言实现了一个微型 GPT(Microgpt),据称在 Apple M5 芯片上跑出了惊人的 1000 万 tokens/秒(10M tps)推理速度。这一数据若属实,将大幅刷新人们对端侧大模型推理效率的认知,也再次引发关于“算法效率比堆算力更重要”的讨论。