标签: ChatGPT

Anthropic prices Fable 5.1 at $10/1M input tokens and $50/1M output tokens, unchanged from Fable 5, and cuts cache read pricing by 75% to $0.25/1M tokens (Frederic Lardinois/The New Stack)

Anthropic prices Fable 5.1 at $10/1M input tokens and $50/1M output tokens, unchanged from Fable 5, and cuts cache read pricing by 75% to $0.25/1M tokens (Frederic Lardinois/The New Stack)

Anthropic 将其最新模型 Fable 5.1 的 API 定价维持在 Fable 5 的水平(输入 $10/百万 tokens、输出 $50/百万 tokens),但将缓存读取价格大幅下调 75% 至 $0.25/百万 tokens,直接降低了长上下文和重复调用场景下的推理成本。

LLM 推理的效率前沿

LLM 推理的效率前沿

AI 基础设施公司 Baseten 发表技术长文,系统拆解了大模型推理(Inference)阶段的效率优化方法,区分了“在效率边界内做取舍”和“推动整个效率边界外移”两类技术,为开发者如何在延迟、吞吐量和成本之间做决策提供了实操框架。

LLM 推理的效率前沿

LLM 推理的效率前沿

Hacker News 上关于 LLM 推理效率的讨论指出,真正大幅提升推理性能的关键不在部署环节的调度优化,而在模型架构设计阶段;同时量化技术正引入一条“锯齿状”的效率边界,硬件格式如 MXFP4 和 NVFP4 可能在几乎不损失模型质量的前提下显著提升服务效率。

构建自主目标循环,切实交付成果

构建自主目标循环,切实交付成果

Hacker News 上一篇题为《构建自主目标循环,切实交付成果》的技术文章引发讨论,核心观点是:AI 智能体不能只停留在“能对话”,而要构建可自主设定目标、执行并验收结果的闭环系统,才能在企业场景中真正产生价值。