分类: AI 资讯

MUD能评估LLM吗?一个99美元的概念验证

MUD能评估LLM吗?一个99美元的概念验证

一个成本仅99美元的研究项目,用上世纪80年代的MUD(多用户地牢)文字游戏环境,暴露了当前大模型评估体系的重大盲区——当LLM作为裁判参与评分时,排行榜结果可能被系统性扭曲,而现有统计指标完全无法察觉。

AI实验室在搞Pelicanmaxxing吗?

AI实验室在搞Pelicanmaxxing吗?

一项针对7个前沿大模型生成“骑自行车的鹈鹕”SVG图像的实验表明,AI实验室并未刻意针对这一热门非正式基准进行优化(即“Pelicanmaxxing”)。测试结果显示,所有模型在该特定组合上的表现并未显著优于其他动物-交通工具组合。

MUD能评估LLM吗?一个99美元的概念验证

MUD能评估LLM吗?一个99美元的概念验证

一项名为“MUD评估LLM”的概念验证实验仅花费99美元,却意外发现LLM作为“裁判”评价其他模型时极度不可靠;两个独立LLM法官对同一模型的评分一致性从85%低至22%,且聚合一致性Kappa系数仅为0.04(接近随机),这暴露了当前大量依赖LLM作为评判标准的基准测试的潜在系统性噪声。

Monday.com裁员数百人,专注AI

Monday.com裁员数百人,专注AI

以色列办公软件公司Monday.com宣布裁员约630人(占员工总数20%),作为重组计划的一部分,将资源和投资重心全面转向其AI工作平台。这延续了2026年大型科技公司“裁员换AI”的显著趋势,显示出企业级AI落地的竞争加速从模型层向应用层转移。