The White House says it has met its deadline to establish a voluntary framework for evaluating advanced AI models; it did not provide details of the framework (Maria Curi/Axios)

白宫在限期前宣布已建立评估高级AI模型的自愿框架,但未公布任何细节;这一表态更多是政策姿态,实际监管力度仍需观察。

白宫在限期前宣布已建立评估高级AI模型的自愿框架,但未公布任何细节;这一表态更多是政策姿态,实际监管力度仍需观察。

根据CNBC的报道,在美国国会的AI工具采购中,OpenAI的ChatGPT以约90%的支出占比遥遥领先,成为立法机构目前花钱最多的AI助手,生成式AI已经进入真实的政府工作流。

AI 评估正在从“看第三方跑分”转向“看自家产品里的用户行为数据”,越来越多的团队开始自建评估体系,跳过 LangSmith、Arize 这类第三方评测工具。

为了获取互联网出现之前“干净”的文本数据,AI训练数据的供应链上出现了“破坏性扫描”的做法——买下稀有旧书、切掉书脊扫描、其余打成纸浆。这件事目前没有确凿证据链,但书商、作者与AI公司之间的信任裂痕已经出现。

OpenAI 联合创始人 Andrej Karpathy 用 Anthropic 的 Claude Opus 5 模型,将《指环王》的一段文字转化为可直接在浏览器中运行的 3D 场景,生成了约 5500 行代码,耗时两小时、成本约 10 美元。这不是严格基准测试,而是一次检验大模型创造力的“氛围测试”。

据知情人士透露,特朗普政府邀请 OpenAI、Google、Anthropic 等头部 AI 公司的员工于本周二前往白宫,参与 AI 监管框架的审查讨论。这是政策制定者与行业核心玩家之间一次罕见的直接沟通,其结果可能影响未来一段时间的 AI 监管走向。

GitHub 用户 Alishahryar1 发布了一个名为 free-claude-code 的开源本地代理,让 Claude Code、Codex、Pi 等编程代理工具可以接上任意模型后端,包括免费模型和本地模型,从而绕开厂商自带的订阅和 API 计费体系。

Product Hunt 上出现一款名为 claudemon 的新工具,从名称与平台定位看,大概率与 Anthropic 旗下 Claude 模型的使用、监控或管理场景相关。目前官方详情页抓取失败,公开信息有限,暂无具体功能、价格或开发商信息。

PISIGuard 是一款针对 AI 聊天场景的个人信息保护工具,目标是防止用户在对话中泄露敏感数据。它出现在 Hacker News 上,反映出 AI 应用普及后隐私保护正从“可选项”变成“必选项”。

阿里巴巴正式发布号称史上最强的 Qwen3.8-Max 大模型,并宣布下周开放模型权重,性能直指 Anthropic 旗舰 Claude Fable 5。这是中国大模型又一次正面冲击美国 AI 霸权,也进一步压缩了闭源路线的差异化空间。