标签: Claude

MUD能评估LLM吗?一个99美元的概念验证

MUD能评估LLM吗?一个99美元的概念验证

一项名为“MUD评估LLM”的概念验证实验仅花费99美元,却意外发现LLM作为“裁判”评价其他模型时极度不可靠;两个独立LLM法官对同一模型的评分一致性从85%低至22%,且聚合一致性Kappa系数仅为0.04(接近随机),这暴露了当前大量依赖LLM作为评判标准的基准测试的潜在系统性噪声。

Monday.com裁员数百人,专注AI

Monday.com裁员数百人,专注AI

以色列办公软件公司Monday.com宣布裁员约630人(占员工总数20%),作为重组计划的一部分,将资源和投资重心全面转向其AI工作平台。这延续了2026年大型科技公司“裁员换AI”的显著趋势,显示出企业级AI落地的竞争加速从模型层向应用层转移。

从 ChatCut 看,通用 Agent 正在争夺专业软件的第一入口

从 ChatCut 看,通用 Agent 正在争夺专业软件的第一入口

视频剪辑工具 ChatCut 从 2025 年 2 月的“文稿剪辑”起步,逐步演进为支持自然语言和生成能力的通用剪辑 Agent,但最新动向显示,它正主动成为 ChatGPT 和 Codex 等通用 Agent 背后的“专业执行层”——这揭示了一条不同于“独立应用”的 AI 产品路线:放弃第一入口,争夺最终执…