一句话看懂:GitHub 上出现了一个名为 PSSA 的小型语言模型,它没有采用 Transformer 架构,而是用 Rust 从零实现了“选择性状态空间 + 情景记忆 + 运行时权重更新”的组合,在相同参数和语料下,官方称其学习更快、CPU 生成速度约为 Transformer 的 12 倍。
事件核心:发生了什么
PSSA(Plastic State-Space Architecture)由作者 Sparticle62ops 发布在 GitHub,并在 Hacker News 上引发讨论。它不是一个基于 PyTorch 或 TensorFlow 的项目,底层没有任何主流机器学习框架,线性代数、反向传播和梯度校验全部用 Rust 手写。模型逐 token 读取文本,通过一个循环状态空间层推进,同时维护一个可检索的“情景记忆库”,并在前向传播过程中改写自身部分权重——这也是“plastic(可塑)”一词的来源。
默认配置为 256 通道、每通道 16 个状态、rank-16 适配器。官方给出的对比是:在匹配参数量和同一语料下,它比 Transformer 学得更快,CPU 推理速度约为后者的 12 倍。目前公开信息显示,该项目仍处于早期阶段,作者明确表示欢迎社区提交 Python 移植版本。
为什么重要
过去两年,大模型的主流路线几乎被 Transformer 垄断,Mamba、S4 等状态空间模型虽然在学术上受到关注,但真正从零实现、且把“记忆检索”和“运行时权重更新”放进同一架构的开源项目并不多。PSSA 的技术选择值得注意:它的循环部分沿用选择性对角 SSM 思路,与 S4、Mamba 同族;真正差异化的是记忆读取和写入机制——查询由当前 token 和当前状态共同生成,在双曲空间(Poincaré ball)中按距离检索最多 4 个记忆槽,并用可学习门控决定多少信息进入残差流。写入方面,新槽位只有在状态足够“新颖”时才插入,且带有限制覆写频率的不应期计数器,长期结构则通过闭式岭回归折叠回基础转移矩阵。
这套设计的直接含义是:每一步的计算成本随序列长度线性增长,而不是 Transformer 的平方级增长;上下文不需要被反复重读。对算力敏感的场景,这可能是一条值得观察的替代路线。
对用户/开发者/创作者的影响
对开发者而言,PSSA 的价值首先在于“可验证性”:作者强调标量参考路径让梯度可以与批量内核逐项对照,误差约 3e-8。这意味着想研究非 Transformer 架构、又不想被自动微分框架束缚的人,有了一个可读、可改的 Rust 代码库。对关注端侧推理和 CPU 部署的团队来说,12 倍生成速度的说法如果能在更多语料和任务上复现,可能影响小模型的产品化路径。对普通用户和创作者,短期内直接影响有限——它还不是一个可直接使用的 API 或消费级产品,也没有公布模型规模、训练数据量和评测基准。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,是否有第三方复现“同参数下学习更快、CPU 推理快 12 倍”的结论,以及测试语料和任务是否具有代表性。第二,Python 移植和社区贡献能否落地,决定它是停留在个人项目还是形成开发者生态。第三,记忆库的容量上限、长序列下的稳定性,以及“运行时权重更新”在真实部署中是否可控,都是需要进一步验证的工程问题。
来源:Hacker News


