现在的 AI 评测榜单可能正在欺骗你。如果你发现模型写代码很强,但用它写小说或学外语却漏洞百出,这其实是行业通病。 Reddit 上关于 AI 评测基准(Benchmark)的讨论引起了热议:为什么现在的模型榜单几乎全是代码能力?对于普通用户来说,这背后的信息差很大: 1. 代码评测更容易量化。代码有明确的对错和运行结果,而创意写作、逻辑推理或语言学习的主观性太强,导致开发者倾向于在代码领域卷分数,从而出现所谓的刷榜行为。 2. 模型…

AI 模型榜单正在被代码能力主导,普通用户看着高分选出的模型,在写作、学外语等日常任务上可能表现糟糕。评测指标和真实使用场景脱节,正在成为大模型选型的新陷阱。








