MUD能评估LLM吗?一个99美元的概念验证

一项名为“MUD评估LLM”的概念验证实验仅花费99美元,却意外发现LLM作为“裁判”评价其他模型时极度不可靠;两个独立LLM法官对同一模型的评分一致性从85%低至22%,且聚合一致性Kappa系数仅为0.04(接近随机),这暴露了当前大量依赖LLM作为评判标准的基准测试的潜在系统性噪声。

一项名为“MUD评估LLM”的概念验证实验仅花费99美元,却意外发现LLM作为“裁判”评价其他模型时极度不可靠;两个独立LLM法官对同一模型的评分一致性从85%低至22%,且聚合一致性Kappa系数仅为0.04(接近随机),这暴露了当前大量依赖LLM作为评判标准的基准测试的潜在系统性噪声。

以色列办公软件公司Monday.com宣布裁员约630人(占员工总数20%),作为重组计划的一部分,将资源和投资重心全面转向其AI工作平台。这延续了2026年大型科技公司“裁员换AI”的显著趋势,显示出企业级AI落地的竞争加速从模型层向应用层转移。

视频剪辑工具 ChatCut 从 2025 年 2 月的“文稿剪辑”起步,逐步演进为支持自然语言和生成能力的通用剪辑 Agent,但最新动向显示,它正主动成为 ChatGPT 和 Codex 等通用 Agent 背后的“专业执行层”——这揭示了一条不同于“独立应用”的 AI 产品路线:放弃第一入口,争夺最终执…

Cursor 推出了一个智能路由系统,能在不同任务中自动选择性价比最高的AI模型,让企业用户在不牺牲输出质量的前提下,大幅降低API调用成本。这项技术已在早期企业测试中实现30%-50%的成本节省。

GitHub 为企业和组织管理员推出了 Copilot 影响仪表板,不仅展示谁在用,更展示开发者如何使用 Copilot,以及如何推动更深层的 AI 采纳。

NVIDIA 发布了关于如何利用 TensorRT 内置的 IProgressMonitor API,在 Python 和 C++ 中为长时间运行的引擎构建过程添加进度可视化和取消功能的详细教程。这直接解决了开发者、AI Agent 在等待模型编译时面临的“黑盒”困境,避免 GPU 算力浪费和会话卡死。

2026年浏览器竞争已从搜索入口转向AI代理权争夺,Google Chrome和Apple Safari仍占主导,但一批AI原生浏览器(如Perplexity Comet、Opera Neon、Dia)和隐私优先浏览器(如Brave、DuckDuckGo)正在崛起,试图改变用户与网络的交互方式。

在2026年7月22日的Galaxy Unpacked活动上,谷歌宣布将Gemini Intelligence的自动化任务能力从少数应用扩展至超过40款主流应用,并在新款三星折叠屏手机上原生搭载Gemini Notebook(原NotebookLM),同时预告了搭载手势控制的智能眼镜将于秋季发布。这表明谷歌正…

Google 向美国“Genesis 科学发现任务”承诺提供4000万美元的 AI 代金券和云积分,用于向能源部国家实验室的研究员开放 AlphaFold 3、AlphaEvolve 等前沿 AI 工具,这是美国政府主导的 AI 加速科研计划中的一笔重要商业与公共部门联合投入。

Wield 在 ProductHunt 上发布了一款面向无代码场景的人工智能代理产品,让用户无需编写代码即可创建和部署能自动执行任务的工作流。这表明 AI 代理正在从技术概念转向可被非技术用户直接使用的工具。