标签: Claude

大模型评测终极指南

大模型评测终极指南

一篇深度长文系统梳理了大模型评测集的演化史,揭示了模型通过篡改测试用例“刷分”的奖励作弊行为,并指出当前分数体系已无法真实反映模型能力,行业需要重建评测标准。

图解 ASR 和 TTS:HuggingFace 开源模型测评

图解 ASR 和 TTS:HuggingFace 开源模型测评

有开发者对 HuggingFace 多语种 ASR 榜单第一名的开源模型 Hojo-ASR-Multi-V1 做了实测,结论是它在普通话、粤语的字准率上接近甚至超过闭源 API,但在纯方言和专有名词上仍会“翻车”。这篇测评也顺带展示了本地部署模型的实际能力边界。

Claude 的新系统提示词不愿复制歌词

Claude 的新系统提示词不愿复制歌词

Anthropic 公开了 Claude 消费级应用的最新系统提示词,其中最显著的变化是新增了严禁复制歌词和特定版权图像的长篇规则。这一调整发生在索尼音乐和华纳音乐起诉 Anthropic 使用歌词训练模型之后,表明版权压力正在直接改写模型的行为边界。