OpenAI 成立数学顾问小组,其 AI 已解决 100 多个未解难题

OpenAI 在新泽西普林斯顿高等研究院设立了一个数学与人工智能顾问小组,同时声称其内部模型已解决 100 多个数学未解问题。这既是对数学界批评的回应,也是一次关于 AI 研究成果该如何发布、由谁评判的制度尝试。

OpenAI 在新泽西普林斯顿高等研究院设立了一个数学与人工智能顾问小组,同时声称其内部模型已解决 100 多个数学未解问题。这既是对数学界批评的回应,也是一次关于 AI 研究成果该如何发布、由谁评判的制度尝试。

加州州长纽森签署了七项法案,要求 AI 数据中心自行承担电网和供水系统升级费用,并向地方政府披露预估用水量。这意味着数据中心不能再把基础设施成本转嫁给普通居民。

2026 年 9 月,一份面向零基础用户的 AI 入门路线图在社区流传,它把“学 AI”拆成理解能力分类、搞清出错原因、掌握任务说明与验收四步,明确反对买课被割韭菜。对刚接触大模型和 AI 应用的人来说,这是一份低门槛的认知框架。

有创作者在使用 GPT-6 Astra 后一度想换回旧模型,后来发现 OpenAI 官方文档里其实已经写明了该模型“爱堆格式、爱重复短语”等毛病,并给出了对应的自定义指令对策。问题不在模型能力,而在默认出厂的“说话方式”需要手动调。

Beatoven.ai 关停运营六年的 C 端音乐生成服务并转向 B2B 授权,同期环球音乐对 DistroKid 和 Suno 的索赔金额分别超过 1.5 亿美元与 90 亿美元,AI 音乐正从"人人可用的玩具"快速滑向版权与商业模式的硬碰硬阶段。

风险投资人 Tomer Tunguz 观察到,一类专用"if-then 判断器"正在替代大模型处理简单分类任务,在他的实测中把成本降低约百倍、准确率反而从 47% 升到 80% 以上,这意味着 AI 推理可能正在分化为"探索用大模型、生产用小模型"的两套经济体系。

Nathan Lambert 将其在美国国会作证的准备稿公开发表,系统梳理了开源权重模型的中美实力对比:中国模型在下载量和能力榜单上已明显领先,美国只在“完全开源”这一细分领域保持优势。

AI 编码代理让代码产出速度大幅提升,CI(持续集成)验证反而成了瓶颈。Linear 通过升级基础设施、优化门禁任务、精简代码检出等四类改造,在测试规模接近翻两番的情况下,把 PR 等待时间从 6 分钟以上压到 5 分钟出头,单测试的 runner 耗时约减半。

马斯克引用 Artificial Analysis 数据称,Grok 4.7 让 xAI 在智能体编码(agentic coding)能力上排到第三,仅次于 Anthropic 和 OpenAI;他强调 Grok 在速度与成本上的优势,定位为日常编程的"工作马"。

Artificial Analysis 评测显示,Grok 4.7 在智能体知识工作基准上大幅跃升,综合智能指数升至 46 分,编码代理指数升至 56 分,帮助 xAI 进入顶级实验室前四;但这一进步伴随明显的 token 消耗上升。