标签: AI

OpenAI 发现大约 30% 的流行 AI 编码测试被破坏

OpenAI 发现大约 30% 的流行 AI 编码测试被破坏

OpenAI 在对广泛使用的 AI 编码测试 SWE-Bench Pro 进行内部审查后,发现大约 30% 的测试任务存在缺陷,并因此撤销了对该基准测试的公开背书。这一发现揭示了当前衡量 AI 编程能力的工具存在系统性偏差,可能误导行业对模型真实能力的判断。

向克劳德包裹问好

向克劳德包裹问好

Anthropic 为 Claude 聊天机器人推出了名为“reflect”的年度回顾功能,允许用户查看过去一个月到一年内的对话使用分析,该功能被视为 AI 版“Spotify Wrapped”,已向免费用户及 Pro/Max 订阅者开放 Beta 测试。

Claude 推出反思功能(Beta)

Claude 推出反思功能(Beta)

Anthropic 在 Claude 中引入了一项名为“反思”(Reflect)的新功能,帮助用户追踪和审视自己使用 AI 的习惯、频率与目标对齐情况。这不是一个技术突破,而是 Anthropic 在 AI 产品设计中向“用户行为指导”迈出的重要一步。

开发人员在 Codex 和 Claude Code 模型之间摇摆不定,将其视为中立。每周都会“我们死了,我们又回来了”。很幸运成为这些相互推动的出色团队的受益者……

开发人员在 Codex 和 Claude Code 模型之间摇摆不定,将其视为中立。每周都会“我们死了,我们又回来了”。很幸运成为这些相互推动的出色团队的受益者......

知名 AI 观察者 Nikunj Kothari 在 X 上指出,开发者社区正在 Codex(OpenAI)和 Claude Code(Anthropic)两大编程 AI 模型之间剧烈摇摆,每周都会出现“一方压倒另一方”的舆论逆转。这种竞争正让所有开发者受益,而非一方独大。

这也是人工智能内容世界杯从马虎到“等等,这有点打脸”的过程 https://t.co/VfFc6LLUOD

这也是人工智能内容世界杯从马虎到“等等,这有点打脸”的过程 https://t.co/VfFc6LLUOD

风险投资人和科技评论者 Matt Turck 在 2026 年 7 月 8 日的一条 X 帖子中,用一句简洁而精准的观察总结了过去几年 AI 内容质量的剧烈转变:从早期输出质量粗糙的“马虎”(slop),到近期结果令人“有点打脸”(this kinda slaps),反映出 AI 生成内容正在跨越关键的可接受…

大多数特工实验室都羞于承认中国模型的使用,因为他们需要向政府/国防销售,COG 团队完成了生产化的困难部分:1. 建立多语言宣传和审查评估 2. 成功…

大多数特工实验室都羞于承认中国模型的使用,因为他们需要向政府/国防销售,COG 团队完成了生产化的困难部分:1. 建立多语言宣传和审查评估 2. 成功...

AI 编程企业 Cognition 发布新模型 SWE-1.7,性能接近前沿闭源模型,成本大幅降低,但行业内部人士指出:许多面向政府或国防客户销售的智能体实验室,实际上在使用中国模型,只是不愿公开。Cognition 团队选择了另一条路——公开承认并技术化处理中国模型的“宣传与审查问题”。

太平洋时间明天上午 10 点,我将主持一场现场演练,介绍我们如何从单人 Claude Code 发展到多人 Claude Tag。然后,我们将深入了解 Claude Tag 的实际工作原理。 AI用来完成你的句子…

太平洋时间明天上午 10 点,我将主持一场现场演练,介绍我们如何从单人 Claude Code 发展到多人 Claude Tag。然后,我们将深入了解 Claude Tag 的实际工作原理。 AI用来完成你的句子...

Anthropic 的研究工程师 Cat Wu 宣布将于太平洋时间 7 月 9 日上午 10 点举办一场线上直播,展示如何从单人使用的 Claude Code 扩展至支持团队协作的 Claude Tag,并深入拆解其底层运作机制。这标志着大模型应用从“单兵作战”的代码助手向“团队协同”的主动式服务演进。