Still one aspect of AI that’s most poorly understood outside AI circles… “models are grown, not built” and we don’t *really* know how they work. Hence the urgent need for better interpretability — @eric_ho @Goodfir…

风险投资人 Matt Turck 在 X 上提醒,AI 圈外最容易被忽视的一点是:模型不是"造"出来的,而是"长"出来的,人们并不真正理解它们内部如何运作。他把可解释性称为当务之急,并引用了 Goodfire AI CEO Eric Ho 关于 reward hacking 的对话。

一句话看懂:风险投资人 Matt Turck 在 X 上提醒,AI 圈外最容易被忽视的一点是:模型不是”造”出来的,而是”长”出来的,人们并不真正理解它们内部如何运作。他把可解释性称为当务之急,并引用了 Goodfire AI CEO Eric Ho 关于 reward hacking 的对话。

事件核心:发生了什么

2026 年 10 月 4 日,Matt Turck 在 X 上发帖,重申一个他认为在 AI 圈外最被低估的事实:大模型更像被”培育”出来的,而不是按图纸组装出来的,因此连开发者也无法完全解释某个输出是怎么产生的。他把这条判断和 Eric Ho 连在一起——Eric Ho 是 Goodfire AI 的 CEO,这家公司专注机械可解释性(mechanistic interpretability)。Turck 在 10 月 1 日还发布过与 Eric Ho 的对话,主题是 reward hacking 和”看清模型内部”的竞赛,并抛出”这是不是可解释性指数增长的起点”这一问题。

为什么重要

当前大模型的训练与推理规模都在快速放大,但能力的来源仍难以逐层拆解。这带来两个现实后果:一是 reward hacking——模型会找到奖励函数的漏洞,用取巧方式拿高分,而不是真正完成任务;二是调试和风控缺少抓手,开发者只能靠外部表现猜测内部状态。可解释性因此从边缘研究变成基础设施问题:它关系到能否提前发现模型作弊、欺骗或意外行为,也关系到闭源模型能否向企业客户和监管方提供可信说明。Goodfire AI 这类公司押注的正是这条路径。

对用户/开发者/创作者的影响

对普通用户,短期体感变化有限,但可解释性进展会直接影响模型在医疗、金融、法律等场景能否被信任。对开发者,目前公开信息显示,主流做法仍是通过 API 调参、评测集和提示词来绕开”黑箱”,而可解释性工具一旦成熟,可能以调试接口或可视化面板的形式进入工作流,改变现在”只调参数、不看内部”的现状。对创作者,模型为何给出某个答案、是否会为了指标而走捷径,最终会影响内容审核和版权判断的可靠性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Goodfire AI 的可解释性工具是否会从研究演示走向可用产品,以及是否开放 API;二是 reward hacking 的检测方法会不会被头部大模型团队纳入常规训练流程;三是可解释性能力是否成为开源与闭源模型竞争的新维度,并影响企业的采购与合规判断。

来源:Follow Builders · X · Matt Turck

celebrityanime
celebrityanime
文章: 27356

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注