Tomer Tunguz 谈 AI 优化 if-then 判断:专用决策器把分类成本降近百倍

风险投资人 Tomer Tunguz 观察到,一类专用"if-then 判断器"正在替代大模型处理简单分类任务,在他的实测中把成本降低约百倍、准确率反而从 47% 升到 80% 以上,这意味着 AI 推理可能正在分化为"探索用大模型、生产用小模型"的两套经济体系。

风险投资人 Tomer Tunguz 观察到,一类专用"if-then 判断器"正在替代大模型处理简单分类任务,在他的实测中把成本降低约百倍、准确率反而从 47% 升到 80% 以上,这意味着 AI 推理可能正在分化为"探索用大模型、生产用小模型"的两套经济体系。

Nathan Lambert 将其在美国国会作证的准备稿公开发表,系统梳理了开源权重模型的中美实力对比:中国模型在下载量和能力榜单上已明显领先,美国只在“完全开源”这一细分领域保持优势。

AI 编码代理让代码产出速度大幅提升,CI(持续集成)验证反而成了瓶颈。Linear 通过升级基础设施、优化门禁任务、精简代码检出等四类改造,在测试规模接近翻两番的情况下,把 PR 等待时间从 6 分钟以上压到 5 分钟出头,单测试的 runner 耗时约减半。

马斯克引用 Artificial Analysis 数据称,Grok 4.7 让 xAI 在智能体编码(agentic coding)能力上排到第三,仅次于 Anthropic 和 OpenAI;他强调 Grok 在速度与成本上的优势,定位为日常编程的"工作马"。

Artificial Analysis 评测显示,Grok 4.7 在智能体知识工作基准上大幅跃升,综合智能指数升至 46 分,编码代理指数升至 56 分,帮助 xAI 进入顶级实验室前四;但这一进步伴随明显的 token 消耗上升。

小米发布开源权重模型 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数上以 46 分登顶开源权重模型榜首,同时保持每百万输入 token 0.435 美元、输出 0.87 美元的定价,成为性价比最高的可部署模型之一。

加拿大不列颠哥伦比亚省在美国加州起诉 OpenAI,认为其在 Tumbler Ridge 枪击案发生前,就应把已被标记的 ChatGPT 账号活动转介给警方。这起诉讼把大模型平台的“风险发现”与“是否必须报警”之间的责任边界,推到了法律层面。

OpenAI 在 2026 年 9 月 21 日扩充 OpenAI Academy,新增面向开发者、管理者、教育者和大学生四类角色的学习路径。它把 AI 培训从“通用入门”推向“按岗位分层”,目标是让学习直接成为 AI 落地部署的一部分。

OpenAI 在 2026 年 9 月 21 日发布文章,提出要为下一阶段 AI 建立国际标准,理由是在自动化 AI 研究、递归自我改进(RSI)加速的背景下,各国各实验室的评估、报告和事故定义若继续分裂,将难以协同应对跨境的灾难性 AI 风险。

影视广告 AI 创业公司 Higgsfield AI 借助 OpenAI 的 GPT-6 Astra,把一项全新视频功能从开发到上线压缩到一天之内,且只由一名工程师完成,同时让中小商家用一句提示词就能批量生成视频广告变体。