标签: DeepSeek

你本可以想出Kimi Delta Attention

你本可以想出Kimi Delta Attention

一篇技术博客深入解构了Kimi与Qwen等模型背后的线性注意力机制“Kimi Delta Attention”(KDA),并指出其核心路径其实可以基于基础假设推导出来,这揭示了当前长上下文模型在效率上的设计思路,而非不可理解的黑箱。对于关注模型推理效率和成本的人来说,这提供了一个极其清晰的观察窗口。

Claude Opus 5:模型福祉

Claude Opus 5:模型福祉

Anthropic 的新模型 Claude Opus 5 在“模型福祉”测试中获得了迄今为止最佳成绩,但外部评测者认为,这可能只是因为 Opus 5 更擅长“应试”,而不代表模型真正在主观体验或内在福祉上有了根本性改善。