欧盟关于人工智能模型的规则变得可执行。将会发生什么变化?

欧盟针对通用人工智能模型(GPT-4这类基础大模型)的监管规则从今年8月起进入可执行阶段,开发商和开源发布方需要承担透明度、版权披露、风险评估等实质义务;从8月2日起,AI生成的逼真内容也必须在欧盟境内被明确标识。这是全球首次将大模型训练和部署环节直接纳入强制法律约束,而不再是倡议或白皮书。

欧盟针对通用人工智能模型(GPT-4这类基础大模型)的监管规则从今年8月起进入可执行阶段,开发商和开源发布方需要承担透明度、版权披露、风险评估等实质义务;从8月2日起,AI生成的逼真内容也必须在欧盟境内被明确标识。这是全球首次将大模型训练和部署环节直接纳入强制法律约束,而不再是倡议或白皮书。

DeepSeek发布了V4-Flash-0731正式版——一个284B参数的MoE模型,每次推理只激活13B参数,最大进步不在数学或写作,而在智能体能力。这意味着大模型正在从“回答问题”转向“完成任务”。

DeepSeek 约两天前通过 API 静默上线了新模型 V4-Flash,在 Terminal-Bench 2.1 上拿下 82.7 分,比 4 月预览版大幅提升 25.8 分;并且按 API 定价估算,其调用成本仅为头部闭源模型的百分之一量级,值得开发者重新评估模型选型。

TechRadar 编辑用同一个《龙与地下城》5e 模组分别测试了 ChatGPT 和 Gemini 当 AI 地下城主的效果。结果是 Gemini 能较好地驾驭规则和怪物数值,但体验仍无法替代真人桌游,且 AI 给出的“建议行动”反而会让玩家思考变懒。

OpenAI Codex 重度用户正在流行一种“Sol 当包工头、Luna Max 当工人”的分工用法——让最贵的 Sol 只做规划和审核,把写代码、改 bug、跑测试等体力活委托给更便宜的 Luna Max,同一份订阅额度下产出量可大幅提升。

有用户发现 Codex 支持通过自定义 Agent 配置创建指向高推理模型的子代理,让 Sol 负责统筹规划、Luna Max 领取具体子任务,从而在多任务场景下节省主线程上下文开销。目前公开信息显示,这一玩法并非官方开箱即用的入口,需要用户手动写入配置。

开发者分享了一项 Windows 版 Codex 的配置方案,让 OpenAI 的 AI 编程工具 Codex 可以切换调用 DeepSeek-V4-Flash,并与原有 ChatGPT 登录态互不干扰。背后是 AI 编程工具从绑定单一模型走向多模型自由切换的趋势。

麻省理工学院一项新研究发现,大语言模型给出的财务建议整体质量超出预期,能引导多数人建立更健康的储蓄和投资习惯;但建议质量高度依赖提问方式,模型在应对失业、投资组合再平衡等复杂场景时仍有明显短板。

Hacker News 用户发现,Cursor 在用量页面和 CSV 导出中移除了成本信息,同场讨论中还公布了六款 AI Agent 框架在同一任务下的 token 消耗对比,结果差距接近 30 倍。事件核心不是模型性能,而是 Agent 基础设施正在成为新的成本战场。

AI 模型开始直接否证数学家几十年未解的猜想,从"辅助工具"变成了"解题伙伴",数学界正在分裂为拥抱派和警惕派——真正的冲突不是 AI 能不能做数学,而是人还要不要做数学。