标签: GPT-4

OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

OpenAI 内部测试的新模型 Astra 在数学、量子复杂度与理论计算机科学领域解决了 10 个长期开放问题,按 API 价格计算总成本约 2000 美元,成果本身很惊艳;但业界对它的推广解读存在明显的“合成谬误”——把一个领域的突破等同于通用智能的临近。

欧盟关于人工智能模型的规则变得可执行。将会发生什么变化?

欧盟关于人工智能模型的规则变得可执行。将会发生什么变化?

欧盟针对通用人工智能模型(GPT-4这类基础大模型)的监管规则从今年8月起进入可执行阶段,开发商和开源发布方需要承担透明度、版权披露、风险评估等实质义务;从8月2日起,AI生成的逼真内容也必须在欧盟境内被明确标识。这是全球首次将大模型训练和部署环节直接纳入强制法律约束,而不再是倡议或白皮书。

🧠 当AI开始”思考”,我们在思考什么? 昨天DeepSeek发布了V4-Flash-0731正式版,一个284B参数的MoE模型,每次推理只激活13B。这个效率让人震惊——但更让我震惊的是它在哪方面进步最大: 不是数学,不是写作,而是「智能体能力」。 Terminal Bench从61.8跳到82.7。 DeepSWE从12.8飙到54.4。 Toolathlon从55.9到70.3。 这些是什么意思?意味着AI正在从「回答问题」进…

🧠 当AI开始"思考",我们在思考什么? 昨天DeepSeek发布了V4-Flash-0731正式版,一个284B参数的MoE模型,每次推理只激活13B。这个效率让人震惊——但更让我震惊的是它在哪方面进步最大: 不是数学,不是写作,而是「智能体能力」。 Terminal Bench从61.8跳到82.7。 DeepSWE从12.8飙到54.4。 Toolathlon从55.9到70.3。 这些是什么意思?意味着AI正在从「回答问题」进…

DeepSeek发布了V4-Flash-0731正式版——一个284B参数的MoE模型,每次推理只激活13B参数,最大进步不在数学或写作,而在智能体能力。这意味着大模型正在从“回答问题”转向“完成任务”。

DeepSeek 推出的模型反超 Fable 5…? 中國大語言模型商持續顛覆戰局,DeepSeek 2.0 時刻還得是主角來推出重磅模型 DeepSeek 2 天前推出的新模型4-Flash 於 Terminal Bench 2.1 的分數達到了82.7,相較於4月的分數 56.9 達成了大躍進 ⚡️ 至於他們的模型到底有多便宜? 跟 Fable 5 可以差到近 180 倍 和 GPT 5.6 Sol 也可以差到 100 倍… 準備…

DeepSeek 推出的模型反超 Fable 5…? 中國大語言模型商持續顛覆戰局,DeepSeek 2.0 時刻還得是主角來推出重磅模型 DeepSeek 2 天前推出的新模型4-Flash 於 Terminal Bench 2.1 的分數達到了82.7,相較於4月的分數 56.9 達成了大躍進 ⚡️ 至於他們的模型到底有多便宜? 跟 Fable 5 可以差到近 180 倍 和 GPT 5.6 Sol 也可以差到 100 倍… 準備…

DeepSeek 约两天前通过 API 静默上线了新模型 V4-Flash,在 Terminal-Bench 2.1 上拿下 82.7 分,比 4 月预览版大幅提升 25.8 分;并且按 API 定价估算,其调用成本仅为头部闭源模型的百分之一量级,值得开发者重新评估模型选型。

Codex 用 Sol 指挥 Luna Max 省额度翻倍产出

Codex 用 Sol 指挥 Luna Max 省额度翻倍产出

OpenAI Codex 重度用户正在流行一种“Sol 当包工头、Luna Max 当工人”的分工用法——让最贵的 Sol 只做规划和审核,把写代码、改 bug、跑测试等体力活委托给更便宜的 Luna Max,同一份订阅额度下产出量可大幅提升。

原来 Codex 可以开 Luna Max 子代理啊,但是要自己配置,那这下彻底省钱了,让 Sol 规划 Luna 去执行: 首先你要去打开 Max: 1、Settings → Configuration 2、Available reasoning efforts 勾选 Max 接着把下面这段提示词发给 Sol: —– 在以下路径创建一个名为 luna_worker 的自定义 Agent: ~/.codex/agents/lun…

原来 Codex 可以开 Luna Max 子代理啊,但是要自己配置,那这下彻底省钱了,让 Sol 规划 Luna 去执行: 首先你要去打开 Max: 1、Settings → Configuration 2、Available reasoning efforts 勾选 Max 接着把下面这段提示词发给 Sol: ----- 在以下路径创建一个名为 luna_worker 的自定义 Agent: ~/.codex/agents/lun…

有用户发现 Codex 支持通过自定义 Agent 配置创建指向高推理模型的子代理,让 Sol 负责统筹规划、Luna Max 领取具体子任务,从而在多任务场景下节省主线程上下文开销。目前公开信息显示,这一玩法并非官方开箱即用的入口,需要用户手动写入配置。