Anthropic 发布前沿 AI 开发节奏测量工具与内部指标快照

Anthropic 发布前沿 AI 开发节奏测量工具与内部指标快照

Anthropic 公开了一套衡量“前沿实验室内部 AI 研发自动化程度”的指标框架,并首次披露内部快照:截至 2026 年 8 月,Claude 尚未在任何被测量的研发环节实现完全自主,但在约 26% 的工作中已能“主导”任务。这为外界观察 AI 是否正在加速自我迭代提供了可核查的抓手。

Codex CLI 0.155.0

Codex CLI 0.155.0

OpenAI 发布 Codex CLI 0.155.0,加入实验性语音对话、实时推理摘要、任务归档和 Touch ID 验证等能力,把命令行编程代理从“能跑代码”推向“可管理、可验证、可恢复”的日常工具。

Agentic CLI 自定义功能现已加入使用指标 API

Agentic CLI 自定义功能现已加入使用指标 API

GitHub Copilot CLI 的用量指标 API 新增了 agentic 自定义功能的统计口径,企业和管理员现在能看清 skills、自定义 agent、MCP server、斜杠命令和插件到底被用了多少、用了多少种。这意味着 Copilot CLI 的“可扩展层”第一次被纳入可量化管理。

当使用 AI 水印时,LLM 对有害提示词的响应会有所不同

当使用 AI 水印时,LLM 对有害提示词的响应会有所不同

研究发现,为响应欧盟法规而部署的 AI 文本水印技术(如 Google 的 SynthID-Text)会改变大模型的采样行为,不仅影响选词,还会让模型在对抗性提示下更容易突破安全护栏、执行本应拒绝的有害请求。这对正在合规部署水印的厂商和依赖模型的 AI 应用来说,是一个需要提前测试的风险点。