Soup v0.72.4:在4 GB显存笔记本GPU上微调8B模型

开源工具 Soup 推出了 v0.72.4 版本,让开发者在 4GB 显存的笔记本 GPU 上也能微调 8B 参数大模型,并新支持了 DPO、ORPO 等偏好对齐训练。它用"层流式加载"技术把显存占用压到 3.32GB,大幅降低了消费级硬件做 LLM 微调的门槛。

一句话看懂:开源工具 Soup 推出了 v0.72.4 版本,让开发者在 4GB 显存的笔记本 GPU 上也能微调 8B 参数大模型,并新支持了 DPO、ORPO 等偏好对齐训练。它用”层流式加载”技术把显存占用压到 3.32GB,大幅降低了消费级硬件做 LLM 微调的门槛。

事件核心:发生了什么

Soup 是一个把大模型微调流程封装成”一条命令”的开源 CLI 工具,主打无需 SSH、无需配置服务器。v0.72.4 版本的关键变化,是把层流式训练(layer streaming)扩展到了偏好对齐阶段——此前它只支持监督微调(SFT),现在 DPO、ORPO、SimPO、KTO 四种偏好损失也都能在流式模式下运行。

这套方案的实际效果在 RTX 3050 Laptop 4GB 上做了实测:用 Llama-3.1-8B-Instruct + NF4 量化 + LoRA,峰值显存 3.32GB,吞吐 119.6 token/s,并且输出与常规非流式训练逐位一致(bit-exact)。DPO 的参考模型不需要额外复制一份权重,实测峰值只有 SFT 的 0.914 倍,如果强行加载第二个模型则要多占 730MB 显存。代价是时间:DPO 每步读取层栈的频率是 SFT 的 1.52 倍。GRPO 和 PPO 则被刻意排除,因为生成阶段每个 token 都要重读各层,流式无法摊销成本。

为什么重要

大模型微调长期被算力门槛卡住。8B 模型在消费级显卡上做全参微调基本不可能,通常依赖 QLoRA 等量化方案,但显存依然紧张。Soup 的思路是把”冻结的基础模型”从显存中挪出去(放在 RAM 或 NVMe 磁盘),按层顺序喂入 GPU,只让可训练的适配器驻留显存。这相当于把微调工具从”云端专用”拉回到”笔记本可用”的范畴。

更值得注意的是 DPO 等对齐方法也被纳入同一套流式框架。偏好对齐是大模型”说人话”的关键步骤,过去即使做 LoRA 微调,DPO 也需要额外加载一个参考模型,显存成本接近翻倍。Soup 用”同一套流式权重、断开适配器”的方式绕过了这个开销,同时保持输出可复现。Hacker News 上该项目获得热议,核心在于它把”微调-对齐-评估”整条链路压缩到了单机单卡可完成,且所有测量数据公开可查。

对用户/开发者/创作者的影响

对独立开发者和研究者来说,这意味着微调 8B 级模型不再默认需要租用 A100/H100 云实例,一台 4GB 显存的旧游戏本也能完成从 SFT 到偏好对齐的完整流程。Soup 采用 YAML 单文件配置,自动处理批量大小、量化、GPU 检测,省掉了大量环境调试时间。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对需要私有化部署或处理敏感数据的小团队,这个工具提供了不送数据上云的本地微调路径。配合 v0.71.38 版本加入的离线评测门禁(soup ship),开发者可以在不上传数据的前提下,对一个微调结果是否适合发布做自动检查。创作者如果不是程序员,暂时不会直接用到这类工具,但底层生态的普及会降低定制模型服务的报价——当微调成本从”按小时租卡的云端账单”变成”自己电脑的几分钱电费”,定制模型的边际成本会显著下降。

需要警惕的是,核心功能仍标注 BETA,并且只适配层流式优化的损失函数。PPO/GRPO 这类更复杂的对齐算法依然需要传统显存方案。

值得关注的后续

目前公开信息显示,Soup 的项目页提供了完整的性能测试方法和对比数据,这是一个好信号。接下来有三个观察点:

第一,v0.72.1 修复了旧版适配器在流式模式下保存的 tensor 键名问题,意味着此前用 v0.72.0 训练出的适配器可能是无效的——这个兼容性坑是否已完全解决,社区反馈值得跟踪。

第二,层流式训练把压力从显存转移到了 RAM/磁盘带宽,NVMe 用户和普通 SATA SSD 用户之间的体验差距可能很大,这一点在官方文档中虽已承认,但尚未看到系统的存储速度影响测试。

第三,该项目已衍生出网页、Discord 和模型库,说明作者在有意经营生态。若后续能稳定支持序列级打包、更长上下文,并补齐与 Hugging Face PEFT 等主流生态的互操作,它有机会成为消费级微调的事实标准之一。

来源:Hacker News 热门(buzzing.cc 中文翻译)

celebrityanime
celebrityanime
文章: 16935

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注