PSSA:一个用 Rust 从零编写的非 Transformer 语言模型

Hacker News 上出现了一个用 Rust 从零编写的非 Transformer 语言模型 PSSA,作者试图用选择性状态空间模型替代注意力机制;但社区讨论的焦点很快从架构本身转向了实验对比是否公平、代码与文档是否一致。

Hacker News 上出现了一个用 Rust 从零编写的非 Transformer 语言模型 PSSA,作者试图用选择性状态空间模型替代注意力机制;但社区讨论的焦点很快从架构本身转向了实验对比是否公平、代码与文档是否一致。

GitHub 上出现了一个名为 PSSA 的小型语言模型,它没有采用 Transformer 架构,而是用 Rust 从零实现了“选择性状态空间 + 情景记忆 + 运行时权重更新”的组合,在相同参数和语料下,官方称其学习更快、CPU 生成速度约为 Transformer 的 12 倍。

一位开发者在 Hacker News 发帖求助:同时使用多个 AI coding agent 时,每月 20 美元档的用量额度很快撞墙,但升级到每 agent 每月 100–200 美元又负担不起,他想知道如何在工具之间切换时保住正在进行的上下文和任务。

OpenAI 在 DevDay 上发布了名为 Dots 的常驻式 AI agent 系统,但这个名字与两家中国 AI 公司及一家女装品牌重名,还意外把流量引向了马斯克旗下 Grok Bot 的下载页,引发大量检索与品牌混淆。

DeepSeek 宣布与华为合作,为华为昇腾芯片开发编程工具,其中包含开源项目 TileLang——一个对标 CUDA 的替代方案。这意味着国产 AI 芯片在软件生态上又多了一个来自头部大模型公司的盟友。

美国卫生部长小罗伯特·肯尼迪(RFK Jr.)公开表示,AI 能提供“比全国任何医生都更充分掌握信息的第二诊疗意见”,并可“把美国人从医疗暴政中解放出来”。这是一次把大模型直接放进医疗决策场景的高层表态,值得关注其后续是否会转化为监管与采购动作。

DeepSeek Harness(DSH)推出桌面版,安装后自动升级到 v0.1.7-rc.2,把原先需要在终端跑 pnpm dsh web 再开浏览器访问的流程打包成一个 Electron 应用。它没有重写界面,而是补上了自动更新、账号登录、任务后台运行等 WebUI 做不到的事。

这个报错通常发生在 CrewAI 中通过 LLM(...).get_context_window_size() 查询 Gemini 或 Bedrock 模型上下文窗口时,返回的数值与模型官方窗口不一致,优先排查 gemini-2.0-flash-thinking 的 32k 残留配置,以及 Bedr
![[IMPROVEMENT] Single source of truth for LLM context window sizes](https://www.chat-gpts.plus/wp-content/uploads/2026/09/7304-c54138c9-768x403.jpg)
当你在 CrewAI 里给 o1 / o1-pro / o3、gpt-5 系列、Claude 1M 模型或 Bedrock 区域前缀模型设置上下文窗口时,如果发现实际生效的窗口被回退成 8192、200k 等“默认值”,通常说明命中了一份漂移过的硬编码上下文窗口表;优先排查模型 ID 与各 Prov

openJiuwen 开源工作台 WorkSwarm 发布全双工多模态能力,让用户能像打电话一样随时打断 AI,同时把查资料、调工具等耗时任务交给后台 Core Agent 并行处理。它把"对话不中断、任务不停跑"从演示推向了可安装使用。