RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

伯克利与 MIT 团队开源了推理引擎 FreeToken,它通过动态调度 CPU 与 GPU 协同计算,让 RTX 4060 这类 8GB 显存显卡也能跑到每秒 39 Token 的 35B 参数 MoE 模型,消费级硬件运行前沿大模型的门槛被显著拉低。

一句话看懂:伯克利与 MIT 团队开源了推理引擎 FreeToken,它通过动态调度 CPU 与 GPU 协同计算,让 RTX 4060 这类 8GB 显存显卡也能跑到每秒 39 Token 的 35B 参数 MoE 模型,消费级硬件运行前沿大模型的门槛被显著拉低。

事件核心:发生了什么

加州大学伯克利分校和麻省理工学院的研究人员联合推出了开源推理引擎 FreeToken,项目共同作者包括 Databricks 联合创始人 Matei Zaharia 和 Ion Stoica,以及 Song Han、Kurt Keutzer 等人。该引擎专门面向混合专家(MoE)模型在消费级硬件上的推理场景,核心思路是打破传统静态专家卸载机制的瓶颈。

传统的边缘推理方案中,未激活的专家权重驻留在系统内存中,一旦被激活就同步传输给 GPU,PCIe 带宽(通常 16~64 GB/s)和主机内存延迟会让解码过程频繁停顿。FreeToken 采用名为 q* 策略的动态协同调度方案,在缓存未命中时让 CPU 核心与 GPU 张量核心共同分担 Token 计算,并通过快速权重格式和整层双缓冲,使 PCIe 权重传输与计算层执行完全重叠。根据论文基准测试,FreeToken 在配备 8GB 显存 RTX 4060 的笔记本上运行 Qwen3.6-35B 模型,速度约为每秒 39 个 Token;测试环境还覆盖了 RTX 5090 上的 DeepSeek-V4-Flash(284B)及单块工作站 GPU 上的 GLM-5.2(753B)。目前工具已通过 FlashML.ai 和 GitHub 仓库发布,支持 Linux 和 Windows 上的 RTX 30/40/50 系列 GPU。

为什么重要

FreeToken 改变了边缘 AI 的资源认知方式:它不再把个人电脑看作受限的数据中心节点,而是将 CPU、GPU 和异构内存视为可弹性调度的整体计算资源。现有运行时中,Ollama 和 llama.cpp 针对 GGUF 量化和逐层卸载优化,但无法在主机与设备间动态分配稀疏专家负载;vLLM 和 SGLang 则面向数据中心高带宽互连设计;KTransformers 仍采用静态 CPU/GPU 卸载规则。FreeToken 会实时计算每一层的闭式最优分配方案,在相同 MoE 模型上解码速度快 3~4 倍,预填充速度快 6~30 倍。

更值得关注的是它在智能体场景中的设计。现代编程助手会频繁修改提示词、插入工具调用结果或生成思考块,这让标准 KV 缓存不断失效并触发完整重计算。FreeToken 引入了语义锚点检查点机制,在逻辑任务边界缓存中间状态——当智能体修改工具参数或插入外部结果时,可复用已有子序列状态。目前公开信息显示,社区讨论的焦点已从“能否跑起来”转向“协同调度在真实环境中的效率边界”,Hacker News 和 LocalLLaMA 论坛的开发者正在评估理论调度方案与 CPU 调度延迟、内存争用之间的差距。

对用户/开发者/创作者的影响

对普通用户而言,这意味着“本地跑大模型”不再被显存容量锁死。二手 RTX 3090/4080 搭配标准 DDR4/DDR5 内存即可自行托管前沿推理智能体,避免持续支付云 API 费用,也降低了对专有 API 的依赖。对开发者来说,FreeToken 提供了新的部署选项:llama.cpp 的用户在对比基准时需注意其动态调度与手工调优静态配置的差异,而智能体开发者则可以利用语义锚点检查点减少长对话场景下的重复计算。值得留意的是,当前版本仅支持 NVIDIA RTX 30 系列及以上 GPU,AMD 或 Intel 硬件用户暂无法直接使用。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 FreeToken 与 llama.cpp/Ollama 在不同 MoE 模型及真实 CPU 调度延迟下的实测差距能否持续保持,社区基准测试的结果值得追踪。二是其弹性内存管理器是否会吸引 vLLM 或 SGLang 生态借鉴,推动数据中心推理框架向异构内存场景延伸。三是 8GB 显存跑 35B 模型的实际体验——39 Token/秒的吞吐能否支撑起复杂的智能体多轮交互,还需更多开发者实测反馈。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 22017

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注