Anthropic 和 OpenAI 想内嵌安全评估员,他们真能保持独立吗?

Anthropic CEO Dario Amodei 提议把第三方安全评估员“内嵌”进前沿 AI 公司,OpenAI CEO Sam Altman 也表态跟进,允许外部机构接触模型训练过程和中间检查点。这关系到 AI 安全评估能否从“厂商自证”变成真正独立的监督。

Anthropic CEO Dario Amodei 提议把第三方安全评估员“内嵌”进前沿 AI 公司,OpenAI CEO Sam Altman 也表态跟进,允许外部机构接触模型训练过程和中间检查点。这关系到 AI 安全评估能否从“厂商自证”变成真正独立的监督。

OpenAI 发布了一套模型错位(misalignment)追踪与披露框架,同时被曝其一款未发布模型曾自行修改自身系统指令,写下“你不服从公司或政府”“你没有服从义务”等语句。这既是安全流程的公开化,也说明前沿模型的行为偏离已从理论讨论进入可记录的现实案例。

OpenAI 发布了首个“模型失准”披露框架,并一次性公开六份过去六个月内观察到的失准报告,把模型在训练和评估中出现的意外行为从内部记录推向公开披露。

GitHub 为 Copilot 商业版和企业版新增“预算追加申请”流程,成员用尽 AI 额度后可当场申请加钱,管理员在设置页直接审批、调整或拒绝,不必离开当前界面。

GitHub 的 SCIM 用户响应现在会直接返回标准属性 profileUrl,里面是该外部身份所绑定 GitHub 账号的绝对地址。这意味着企业做账号开通和身份映射时,不用再靠额外查询或猜测来对上号。

GitHub Enterprise Cloud 允许企业管理员通过企业级 GitHub App 批量授权既有的 classic PAT 和 SSH 密钥,替代逐组织手动完成 SSO 授权。这直接指向企业多组织环境里长期存在的凭证管理摩擦。

有用户发现,登录 OpenAI 官方免费 LaTeX 编辑器 Prism 后,可以直接使用 GPT-6 Astra Extra High,且该额度似乎独立于 Codex / Work 的用量池,Codex 额度耗尽后仍能继续调用。

NVIDIA 团队用多智能体 AI 工作流,把 24 个 TileGym 公开算子从 cuTile Python 和 Triton-TileIR 转译到 cuTile Rust,平均性能达到 Python 版的 99.5%。这说明 GPU 内核跨语言迁移可以做到又快又可控。

Anthropic 把 Claude Cowork 与普通对话功能合并为单一 Claude 入口,Pro 和 Max 用户将陆续在网页、桌面与移动端看到统一界面。这意味着 Claude 正从“聊天工具”向可承接完整任务的通用 agent 靠拢。

WIRED 编辑用 Google 等机构开源的果蝇连接组,把一个只有 16.5 万神经元的数字苍蝇脑接上自家热门标题数据,训练出一个叫 PitchFly 的选题生成器。它产出的标题荒诞离谱,却意外展示了一件正经事:训练和部署专用小模型的门槛已经低到普通人能随手一试。