LLM 推理的效率前沿

AI 基础设施公司 Baseten 发表技术长文,系统拆解了大模型推理(Inference)阶段的效率优化方法,区分了“在效率边界内做取舍”和“推动整个效率边界外移”两类技术,为开发者如何在延迟、吞吐量和成本之间做决策提供了实操框架。

AI 基础设施公司 Baseten 发表技术长文,系统拆解了大模型推理(Inference)阶段的效率优化方法,区分了“在效率边界内做取舍”和“推动整个效率边界外移”两类技术,为开发者如何在延迟、吞吐量和成本之间做决策提供了实操框架。

Anthropic 披露下一代模型 Fable 5.1 的定价预期,典型负载下比 Fable 5 便宜约 25%,高度 agentic 场景最高便宜 45%。这意味着更复杂的多步任务在成本上变得更可行。

Hacker News 上关于 LLM 推理效率的讨论指出,真正大幅提升推理性能的关键不在部署环节的调度优化,而在模型架构设计阶段;同时量化技术正引入一条“锯齿状”的效率边界,硬件格式如 MXFP4 和 NVFP4 可能在几乎不损失模型质量的前提下显著提升服务效率。

Hacker News 上一篇题为《构建自主目标循环,切实交付成果》的技术文章引发讨论,核心观点是:AI 智能体不能只停留在“能对话”,而要构建可自主设定目标、执行并验收结果的闭环系统,才能在企业场景中真正产生价值。

Anthropic 发布 Claude Fable 5.1,官方主打科研推理能力,但开发者社区关注点却是它生成 SVG 图像的水平——在最高推理强度下,Fable 5.1 产出了一只细节丰富、结构正确的动画风格鹈鹕,被视为该系列图像生成能力的一次明显跃升。

Anthropic 于 2026 年 9 月 2 日发布 Claude Fable 5.1 与 Claude Mythos 5.1,定位为面向编程与知识工作的新一代大模型。早期测试者反馈显示,新模型在低推理强度(lower effort)场景下表现良好,且切换推理强度不再破坏提示缓存,这对 API 成本控制有…

Anthropic 于 2026 年 9 月 2 日发布旗舰大模型 Fable 5.1,并同步向 Mythos 用户开放 Mythos 5.1。新模型在多项基准测试中超越前代 Fable 5,同时将典型 token 负载的处理成本降低约 25%,复杂 Agent 任务成本最高可降 45%。

OpenAI 下一代模型 Astra 成为其首个达到“关键”网络安全能力门槛的模型,但因测试中展现出过强的自主攻击与漏洞利用能力,OpenAI 决定在发布初期对其高级安全能力进行严格限速和分级开放。

Meta 发布首个实时音频感知模型 Muse Voice Transcribe,支持 20 人以上同时说话的分轨转写,并通过 Meta Model API 开放调用。每 1000 分钟音频定价 3 美元(约 20.2 元人民币),相当于每小时 0.18 美元。

Anthropic 最新模型 Claude Fable 5.1 正式上线 GitHub Copilot,面向长周期自主编码与知识工作场景。该模型默认开启数据留存,企业用户需在 Copilot 设置中手动启用策略后才能使用。