标签: ChatGPT

当 LLM 评判者意见一致时,我们该信吗?

当 LLM 评判者意见一致时,我们该信吗?

亚马逊云科技团队在 ICML 上提出一种“依赖感知”的 LLM 评委聚合方法,用 Ising 模型识别多个评审模型之间是否只是“同源同错”,在三个任务上比加权多数投票基线准确率提升 9%–14%,论文时间标注为 2026 年 8 月 26 日。

Internal OpenAI docs detail contractors evaluating anonymized prompts and chats to improve the models; model training is turned on by default for consumer plans (Joseph Cox/404 Media)

Internal OpenAI docs detail contractors evaluating anonymized prompts and chats to improve the models; model training is turned on by default for consumer plans (Joseph Cox/404 Media)

据 404 Media 获得的 OpenAI 内部文档,OpenAI 会安排外包承包商查看经匿名化处理的用户提示词与对话,用于改进模型;同时面向消费级套餐,模型训练默认处于开启状态。这意味着普通用户的聊天内容,可能以脱敏形式进入人工审阅与训练流程。

为什么机器学习研究 Agent 不会过拟合?

为什么机器学习研究 Agent 不会过拟合?

亚马逊科学家在 2026 年 9 月 10 日发布研究指出,LLM 驱动的机器学习研究 Agent 反复在同一基准上迭代却不会过拟合,原因是它们学到的是高度可压缩的策略,而非记住数据。这项工作给"基准刷榜是否等于真实进步"这个老问题提供了可实验的解释。

Bluey Email – AI 邮件营销

Bluey Email - AI 邮件营销

Bluey Email 是一款在 Product Hunt 上线的 AI 邮件营销工具,主打用 AI 辅助生成和优化营销邮件。它切中的是邮件营销长期存在的文案产能低、个性化难、投放反馈慢三个痛点。

AI 负责创造,人来干脏活,这事儿能否停一下?

AI 负责创造,人来干脏活,这事儿能否停一下?

亚马逊云科技在 2026 年 9 月 10 日宣布 AI 办公工具 Amazon Quick 全面可用,它把"动态任务流"放在首屏,试图让 Agent 主动接管邮件、会议、CRM 之间的衔接工作。这值得关注,因为它正面回应了一个被行业长期回避的问题:AI 负责创造,人却在替 AI 干搬运和拼凑的脏活。