OpenArch——现代大型语言模型(LLM)架构的 PyTorch 实现

GitHub 上出现了一个名为 OpenArch 的开源项目,用纯 PyTorch 从零手写实现了 GPT-2 XL、Llama 3、DeepSeek R1、Kimi K2、GLM 4.5 等十余个现代大模型架构,目标不是追求性能,而是让每种架构的注意力、归一化、位置编码等设计选择变得可读、可对比。

一句话看懂:GitHub 上出现了一个名为 OpenArch 的开源项目,用纯 PyTorch 从零手写实现了 GPT-2 XL、Llama 3、DeepSeek R1、Kimi K2、GLM 4.5 等十余个现代大模型架构,目标不是追求性能,而是让每种架构的注意力、归一化、位置编码等设计选择变得可读、可对比。

事件核心:发生了什么

开发者 anuj0456 在 GitHub 发布 OpenArch,按照 Sebastian Raschka 的 LLM Architecture Gallery 清单,逐个手写实现主流开源大模型架构。目前已完成可用前向传播的版本包括:GPT-2 XL(1.5B)、Llama 2(7B)、Llama 3(8B)、OLMo 2(7B)、DeepSeek R1(671B)、Gemma 3(27B)、Mistral 3(24B)、Llama 4 Maverick(400B)、Qwen 3(4B 与 30B-A3B)、Kimi K2(1T)、GLM 4.5(355B)以及 GPT-OSS(20B);Grok-2.5(270B)等仍在建设中。每个模型独立成文件夹,内含一个 model.py 和一个说明架构选择的 README。项目采用 Apache 2.0 协议。

为什么重要

生产级仓库(如 Hugging Face transformers)为了速度、分片和向后兼容,代码往往难以通读。OpenArch 反其道而行,把注意力类型(MHA、GQA、MLA、滑动窗口)、归一化(RMSNorm、QK-Norm)、位置编码(RoPE、NoPE、YaRN)、MoE 路由、多 token 预测等差异摊开在单个文件里,便于横向对比。对想理解“为什么 DeepSeek 用 MLA、Llama 4 用 MoE”的人来说,这是一份低成本的学习材料,也是观察开源大模型技术路线分化的一面镜子。

对用户/开发者/创作者的影响

普通用户不受直接影响。对开发者和研究者,OpenArch 适合作为教学参考、架构实验的起点,或用来核对某个模型的 config 与实际实现是否一致。但需注意:它的定位是“可读优先”,不是可部署的推理框架,不能替代 transformers 或 vLLM 用于生产。创作者若想基于这些架构做微调或二次开发,仍应回到官方权重与生产库。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是剩余约 70 个架构(含多模态、图像模型)能否持续补齐,尤其是 Grok-2.5、Qwen3 多模态等在建项;二是是否有人贡献“加载官方权重并比对输出”的前向测试,这决定实现的可信度;三是社区能否形成对 MoE、混合 Mamba 等新结构的统一对照文档。目前公开信息显示,项目仍以个人维护为主,进度和正确性依赖贡献者投入。

来源:github.com

celebrityanime
celebrityanime
文章: 23456

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注