「从零手写大模型」系列完结了 https://t.co/XR3ZAAJjP7 推理篇 15 篇,训练篇 5 篇,共 20 篇 从模型的基本结构 到如何生成文字,再到损失、梯度与参数更新 把学习过程整理成了一套完整笔记 每一篇都有可练习的代码示例 📖 推理篇 · 15 篇 01|LLM From Scratch:整体大纲路线 02|Tokenizer:分词器 03|Embedding:嵌入层 04|Positional Encoding…

开发者 @antiAIvo 在 X 上宣布,「从零手写大模型」系列笔记正式完结,共 20 篇,其中推理篇 15 篇、训练篇 5 篇,每篇配有可练习的代码示例,站点为 nano-ai.tech/articles/。

一句话看懂:开发者 @antiAIvo 在 X 上宣布,「从零手写大模型」系列笔记正式完结,共 20 篇,其中推理篇 15 篇、训练篇 5 篇,每篇配有可练习的代码示例,站点为 nano-ai.tech/articles/。

事件核心:发生了什么

2026 年 9 月 26 日,账号 @antiAIvo(纳米AI)发布推文称,其「从零手写大模型」系列已全部完结,合计 20 篇:推理篇 15 篇、训练篇 5 篇,发布在 nano-ai.tech/articles/。该推文获得约 1.63 万次浏览、61 次转发、353 次点赞。

推理篇按实现顺序拆解 Transformer 的各个部件:整体大纲、分词器(Tokenizer)、嵌入层(Embedding)、位置编码(Positional Encoding)、自注意力(Self-Attention)、多头注意力(Multi-Head Attention)、残差连接(Residual Connection)、层归一化(LayerNorm)、前馈网络(FFN)、激活函数、Transformer Block 与堆叠、加载预训练权重、文本生成、可解释性。训练篇只有 5 篇:损失函数、反向传播、梯度下降、Adam 优化器、学习率调度。

为什么重要

大模型知识长期被两种内容占据:一边是论文与源码,门槛高;另一边是科普,读完仍写不出可运行代码。「从零手写」系列的价值在于把推理链路和训练链路都落到可练习的代码上,覆盖从分词、注意力到损失、梯度更新的完整闭环。

对行业而言,这类教程属于人才基础设施。开源模型权重持续放出,但能真正改动模型结构、读懂训练日志的人仍是少数。把「推理」与「训练」拆成 15+5 的结构,实际上是在降低从调用 API 到理解内部机制的迁移成本。

对开发者/创作者的影响

开发者可以把它当作自查清单:能否解释清楚多头注意力为什么并行、LayerNorm 放在哪个位置、加载预训练权重时哪些张量需要对齐。文本生成与可解释性两篇对做 AI 应用的团队尤其实用,前者关系推理性能与采样策略,后者关系输出可信度与调试效率。

训练篇只给 5 篇,说明该系列更偏「理解」而非「复现一个大模型」。想真正跑预训练,还需要数据管线、分布式、显存优化、混合精度等工程内容,这部分目前公开信息未涉及。创作者则可借助这套框架组织内容,但需注意逐篇代码示例是核心,单纯转述目录价值有限。

值得关注的后续

一是笔记是否继续更新,比如补齐数据工程、微调(SFT/LoRA)或量化推理;二是代码示例是否配套可运行仓库,能否覆盖不同框架与硬件环境;三是作者在推文中主动邀请指出笔记问题,若形成社区纠错与讨论,这套材料的维护质量会更值得追踪。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:@antiAIvo

celebrityanime
celebrityanime
文章: 25698

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注