周末不开市, 闲聊下, 聊聊为什么 LLM 模型进步这么快吧. 只是聊一下从投资的角度看的话我们可能需要的一点背景知识, 不一定细节准确. 如果我们去开源模型的发布网站 hugging face 里面下载一个开源的 LLM 大模型, 这个下载的包里面有很多组件, 但是核心的模型组件其实就三个. 第一个是叫 tokenizer 的分词器, 它负责把我们输入的 prompt 切成一个一个的”token”, 所以一个token 并不是一个字…

一位投资视角的 AI 观察者 @NullableX 在周末推文中拆解了 LLM(大语言模型)快速迭代的技术原因:模型进步不靠“架构神话”,而在于开源权重、知识蒸馏和合成数据形成了迭代飞轮,这可能会让后来者用算力补齐算法差距,但增长最终会遇到 Transformer 架构的天花板。

一句话看懂:一位投资视角的 AI 观察者 @NullableX 在周末推文中拆解了 LLM(大语言模型)快速迭代的技术原因:模型进步不靠“架构神话”,而在于开源权重、知识蒸馏和合成数据形成了迭代飞轮,这可能会让后来者用算力补齐算法差距,但增长最终会遇到 Transformer 架构的天花板。

事件核心:发生了什么

这条发布于 2026 年 8 月 16 日的推文,以“周末闲聊”的方式做了一次行业科普。作者指出:从 Hugging Face 下载一个开源大模型,核心其实只有三样东西——tokenizer(分词器)、权重矩阵和 config 配置文件。我们日常说的“大模型智能”,本质是一张以十亿计浮点数构成的巨型矩阵。推理时,用户输入的 prompt 先被 tokenizer 切成 token,通过 embedding 映射成小数向量,再经过神经网络逐层计算,最终输出下一个 token 的概率分布,如此循环直到生成完整回答。

训练过程与推理类似,区别在于每次预测错误后,模型会根据 loss 进行反向传播,不断调整矩阵中的小数,让每个 token 在“语义空间”中被推到正确的位置。作者观察到,这个开源生态中已经出现重要变化:新一代模型不再需要像三年前那样从零爬取海量语料,而是可以基于已有开源模型的权重做蒸馏,用强模型生成问题和答案来训练“学生模型”——这正是 DeepSeek 公开蒸馏方法的基本思路。

为什么重要

如果作者判断成立,这会直接影响行业竞争的评估方式:当底层架构仍是 Transformer、主流方法又包含公开的蒸馏技术时,“从零预训练”就不再是唯一路径,竞争焦点从算法创新部分转移到算力获取和工程能力上。作者认为中美模型差距当前主要体现在硬件算力缺口,而不是不可追赶的算法

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18872

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注