构建 Ed-O-Meter:编写自己的 LLM 基准测试笔记

一位开发者发现公共大模型基准测试越来越不可信,于是用自己编写的私有测试集做了一套轻量评测工具 Featherbench,并公开了 Ed-O-Meter 排行榜,用可复现的方式对比模型质量、速度、成本和拒答率。

一位开发者发现公共大模型基准测试越来越不可信,于是用自己编写的私有测试集做了一套轻量评测工具 Featherbench,并公开了 Ed-O-Meter 排行榜,用可复现的方式对比模型质量、速度、成本和拒答率。

斯坦福大学和Arc Institute的研究人员借助AI基础模型Evo 1和Evo 2,设计并合成了一批自然界中不存在的噬菌体基因组,其中16个成功变成了功能完整的病毒。这既为应对细菌耐药性提供了新思路,也让AI设计生物武器的风险从理论走向现实。

一位技术用户在对比 Claude Opus 与 GPT-5.6 时发现,Claude 在技术话题上能给出更具洞察力和语言精度的回答,并据此推测稠密架构(dense model)在语言质量上普遍优于稀疏激活的 MoE 架构。这场讨论把模型的语言功底重新拉回竞争焦点。

Palantir 的企业部署方法论近来被 AI 从业者广泛引用,核心观点是:大模型进入企业后,真正的瓶颈不是模型能力,而是如何把公司的数据、业务规则和决策权力变成 AI 可理解和安全执行的系统。OpenAI 也在 2026 年 5 月专门成立了企业部署公司,投入超 40 亿美元并收购 Tomoro 引进约 1…

北京海淀区启动了一项覆盖43.6平方公里真实城区的城市设计开源征集,特别之处在于:从读取规划数据到生成设计方案,再到通过GitHub Pull Request提交,全程只允许AI Agent参与。

蚂蚁集团正式开源多智能体协作基础设施 Avernet,希望解决多个 AI 智能体协作时“找不到、对不齐、跑不快、留不住”的问题。这可能是多智能体技术从单点演示走向企业生产环境的关键一步。

雅典AI客服公司Omilia完成6700万美元B轮融资,由Expedition Growth领投。这家公司不靠通用大模型讲故事,而是用“自我学习AI代理”切入银行、电信等高要求客服场景,值得关注的是资本正在把真金白银投向垂直场景的AI自动化。

PrimeIntellect 开源了名为 Prime Agent 的编码与研究代理,它能把长周期任务放在后台持续运行,并通过“递归语言模型”让代理学会调用子代理、自我优化工作方法,而非局限于单次对话窗口。

Atlassian CEO Mike Cannon-Brookes宣布将自购2500万美元公司股票,此举发生在公司发布强劲的第四季度业绩之后,意在回应市场对“AI会摧毁订阅制软件商业模式”的担忧。CEO用真金白银下注,说明他押注的方向是AI增强企业软件,而非替代它。

蚂蚁集团开源了多智能体协作基础设施 Avernet,试图解决大模型落地企业时“多个智能体如何像组织一样协同”的问题。目前该平台已在蚂蚁内部 12 个核心业务板块运行,任务完成率超 90%。