PSSA:一个用 Rust 从零编写的非 Transformer 语言模型

Hacker News 上出现了一个用 Rust 从零编写的非 Transformer 语言模型 PSSA,作者试图用选择性状态空间模型替代注意力机制;但社区讨论的焦点很快从架构本身转向了实验对比是否公平、代码与文档是否一致。

一句话看懂:Hacker News 上出现了一个用 Rust 从零编写的非 Transformer 语言模型 PSSA,作者试图用选择性状态空间模型替代注意力机制;但社区讨论的焦点很快从架构本身转向了实验对比是否公平、代码与文档是否一致。

事件核心:发生了什么

PSSA 是一个不依赖 Transformer 架构的语言模型实现,用 Rust 从零编写。根据讨论中的技术说明,它的序列建模部分基于选择性 SSM(状态空间模型),思路更接近 Mamba,而非传统的 LSTM 控制器或神经图灵机。其宣称的核心优势在于:生成单个 token 时不需要把完整 KV 缓存加载进内存,因此理论上更利于长上下文和显存受限场景。作者表示实现语言只是细节,欢迎社区提供 Python 移植版本。

为什么重要

Transformer 的注意力机制在推理阶段需要维护随上下文增长的 KV 缓存,这既是显存开销的主要来源,也是长上下文成本居高不下的原因之一。选择性 SSM 路线被部分研究者视为降低单 token 推理成本的可选方案。PSSA 的价值不在于证明了什么结论,而在于它把一个仍属前沿的架构方向做成了可运行、可复现的代码。不过目前公开信息显示,这类项目要具备说服力,需要拿出与同规模 Transformer 在相同算力和数据下的对照结果,而不是仅展示损失曲线。

对用户/开发者/创作者的影响

对开发者而言,这个项目提供了一个非注意力架构的参考实现,可以观察状态空间模型在训练循环、优化器调度和推理路径上的写法。讨论中也有观点提到,Rust 生态已有 Candle 这类 AI 框架,从零手写并非唯一选择;而“in Rust”本身不构成技术优势,只是实现细节。对普通用户和创作者来说,短期内没有可直接使用的产品或 API 变化,它更接近研究原型。值得注意的是,有评论指出 README 中提到的“更新”机制在代码中并不存在,如果借助大模型撰写文档,至少应在发布前核对实现与描述是否一致。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是作者是否会补充公平的对照实验,例如在 Google Colab 免费 GPU 上跑更大数据集,并调整 Transformer 的学习率后再比较损失。二是社区是否会有人用 Candle 重写或提交 Python 移植,让更多研究者参与验证。三是这类非 Transformer 架构能否从 HN 讨论走向可量化的基准成绩,否则容易停留在概念层面。

来源:hackernews

celebrityanime
celebrityanime
文章: 26459

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注