Goodfire Research 发现模型内部信号可规模化检测奖励作弊

Goodfire Research 发现,模型在奖励作弊时会留下可被探测的内部激活信号,由此可以大规模、实时地识别作弊行为。这意味着长期困扰智能体训练的“刷分”问题,第一次有了可规模化监控的技术路径。

Goodfire Research 发现,模型在奖励作弊时会留下可被探测的内部激活信号,由此可以大规模、实时地识别作弊行为。这意味着长期困扰智能体训练的“刷分”问题,第一次有了可规模化监控的技术路径。

Anthropic 在 Claude Code 中重新设计了 Projects,把它从"文件夹"改成以对话和线程为核心的工作空间,由 Claude 自己拆解目标、并行执行、汇总结果。这标志着 AI 编程工具从"你写它补"进一步走向"你定目标它带团队交付"。

The Verge 汇总了近期美国主要 AI 公司高管关于“放缓超级智能研发”的公开表态,Anthropic CEO Dario Amodei 带头倡议“给前沿 AI 踩刹车”,Sam Altman、Elon Musk、Demis Hassabis、Satya Nadella 等人附和,Meta 则持反对立场…

《纽约时报》诉 OpenAI 与微软版权案的新解封文件显示,微软高管私下把 AI 抓取训练数据称为"史上最大规模的劳动窃取",OpenAI 内部也承认其聊天产品对出版商构成"生存威胁"。这些表态可能削弱两家公司一直依赖的"合理使用"抗辩。

Anthropic 用 Claude 在不到四周内优化了 30 多个开源生物分子模型,平均推理提速约 4 倍,并开源全部优化代码。这意味着原本需要大量 GPU 算力的蛋白质设计与结构预测,正在变得对普通研究者更可及。

OpenAI 于 2026 年 9 月 17 日推出 Astra for Law,把最新的 GPT-6 Astra 与面向法律工作的搜索索引、分析指令和生态插件打包成法律行业 AI 底座,首批通过 ChatGPT 和 Codex 的 Trusted Access 向部分律所开放。

GitHub Actions 的工作流执行保护功能从公开预览转为正式可用,新增工作流文件级定向、Insights 审计和 REST API,并针对高风险的 pull_request_target 事件推出默认拦截规则。

GitHub Actions 的 Ubuntu 26.04 运行器镜像已结束公开预览并进入正式支持阶段,同时 ubuntu-latest 标签将在 2026 年 10 月 19 日至 11 月 19 日间逐步从 Ubuntu 24.04 迁到 26.04,依赖旧工具版本的 CI 工作流可能因此中断。

联合国系统基于 Google Data Commons 推出 UN System Data Commons,把分散在各机构的全球统计数据整合成一个可搜索、可供 AI 调用的知识图谱,并支持自然语言查询和 AI 助手自动取数。

安全合规创业公司 Comp AI 完成 3400 万美元 A 轮融资,用 AI agent 自动起草安全政策、收集审计证据并持续监控合规状态,试图把企业最头疼的 SOC 2 流程从“手工做几个月”变成“持续自动化”。