GulliBench:衡量前沿模型的怀疑精神

Vetto Research 发布名为 GulliBench 的评测集,用 150 个刻意设置“表面数据在说谎”的简单任务,检验大模型是会盲目采信现成字段,还是愿意多一步验证。它提示:模型变聪明和变得可信,是两回事。

Vetto Research 发布名为 GulliBench 的评测集,用 150 个刻意设置“表面数据在说谎”的简单任务,检验大模型是会盲目采信现成字段,还是愿意多一步验证。它提示:模型变聪明和变得可信,是两回事。

纽约时报记者实测了一款热门的AI垃圾检测器,并用“

DeepMind CEO 哈萨比斯在离任前,曾向特朗普政府高层提议成立一个模仿国际原子能机构(IAEA)的独立行业 AI 安全实体。这个想法如果落地,可能改变大模型发布审核、开源策略和跨国 AI 监管的方式。

CoreWeave、Nebius 等 AI 基础设施公司发布超预期财报,显示出算力需求依然坚挺,暂时打消了市场对“AI 资本开支见顶”的担忧。这为重仓 AI 交易的投资者争取到了一个观察窗口:即将发布的英伟达财报将成为下一块试金石。

Anthropic 将 Claude 的 Chrome 扩展升级为 Claude Cowork,让 AI 能以侧边栏形式直接操作浏览器内的各类工作系统。这不是简单加个按钮,而是把浏览器变成了 AI 执行跨平台多步骤任务的统一入口。

DeepSeek 于 2026 年 8 月发布最新模型 V4-Pro,在部分基准测试中与 Kimi K3 相当,但 API 定价显著更低:输入每百万 tokens 收费 0.44 美元,输出每百万 tokens 收费 0.87 美元。这是 DeepSeek 针对性价比区间的一次关键卡位。

开源项目 holaOS 发布了一个本地优先的 AI 代理工作区,让 Claude Code、Codex 等不同代理共用同一套记忆、工具和应用界面,并提供内置前沿模型或自带 API 密钥两种模型接入方式。这个项目把“代理碎片化”问题直接摆到了台面上:多代理协作能否成为下一个 AI 工作流常态。

Qencode 将其视频编码 API 通过 MCP(Model Context Protocol)协议对外开放,这意味着 AI 模型和智能体可以直接调用视频转码、压缩与处理能力,视频处理正从“人工调用接口”进入“AI 自动调度”的早期阶段。

一项覆盖25位顶级AI实验室研究者的访谈显示,自动化AI研究(递归自我改进)的多个预测里程碑已经应验,而最强模型可能不再作为公开产品发布。

该报错通常发生在自托管 Langfuse 搭配 ClickHouse 26.x 时,Scores 页面因查询优化器对 FINAL LEFT JOIN 查询的错误改写而卡在加载骨架。优先排查 ClickHouse 查询优化器设置,以及 Langfuse 容器是否启用了 CLICKHOUSE_DISAB