LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率

一个名为 LoRA Speedrun 的开源项目发布了微调速度排行榜,参与者需在固定硬件(单张 L40S)上微调 Qwen2.5-1.5B 模型至 GSM8K 数学推理准确率 ≥57%,目前最快纪录为 6 分 05 秒(准确率 61.1%)。该项目旨在为参数高效微调(PEFT)技术提供一个可复现、可验证的公平…

LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率

一句话看懂:一个名为 LoRA Speedrun 的开源项目发布了微调速度排行榜,参与者需在固定硬件(单张 L40S)上微调 Qwen2.5-1.5B 模型至 GSM8K 数学推理准确率 ≥57%,目前最快纪录为 6 分 05 秒(准确率 61.1%)。该项目旨在为参数高效微调(PEFT)技术提供一个可复现、可验证的公平竞技场。

事件核心:发生了什么

开发者 @Saivineeth147 发起了 LoRA Speedrun 项目(GitHub 仓库),模仿 nanoGPT speedrun 思路,为 LoRA 等微调技术设立标准化赛道。当前设有两个赛道:Track 1 使用 Qwen2.5-1.5B 模型在 GSM8K 数学数据集上达标(准确率 ≥57%);Track 2 使用 SmolLM2-1.7B 模型在 SQuAD v1.1 阅读理解任务上达标(准确率 ≥75.5%)。硬件统一为 Modal 云平台提供的单张 L40S GPU(48 GB 显存),计时为端到端墙钟时间。所有纪录需在相同硬件上以 3 个不同随机种子独立重跑通过后方可入榜。

目前的 Track 1 最快纪录为 6 分 05 秒,由作者本人创造,使用序列打包(sequence packing)和仅计算补全部分的损失掩码(completion-only loss masking),训练 2 个 epoch,准确率达 61.1%,比基线(11 分 57 秒,59.4%)提速约 1 倍且精度更高。Track 2 基线纪录为 11 分 08 秒(77.5%)。参与者通过 Pull Request 提交方案,经自动化安全扫描、人工审核后,由维护者触发 /verify 命令在云端沙箱中自动验证并公布结果。

为什么重要

当前 LoRA、QLoRA、DoRA、PiSSA 等参数高效微调技术论文常在不同模型、数据集、硬件配置下报告结果,彼此间难以直接比较。LoRA Speedrun 通过固定任务的基座模型、训练数据、硬件规格和准确率达标线,构建了一个“苹果对苹果”的竞争框架。这种公开、可复现的排行榜机制,有望像 nanoGPT speedrun 催生 Muon 优化器一样,推动微调技术从论文印象走向工程实践验证——任何声称更快的技巧,都必须在此环境下跑出可以被第三方重放的成绩。对于算力资源有限的开发者和中小企业,这意味着更清晰的技术选型指引:到底哪种技巧能真正降低微调成本,不再仅凭论文数字判断。

对用户/开发者/创作者的影响

对 AI 工程师和开源贡献者:这是一个零门槛的微调技术试验场。Modal 提供的免费月度计算额度足以覆盖完整的提交和验证流程,任何人可在本地 24 GB 显存显卡上迭代,然后提交至官方的 L40S 环境计时竞速。项目已预设安全审计流程,防止恶意训练脚本触碰测试集或窃取数据,降低了参与门槛。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用微调服务的 C 端用户或小团队:当前纪录表明,在 6 分钟内用 1.5B 参数的 LoRA 模型达到 61% 数学推理准确率,说明小模型的微调效率正在快速提升。未来可能催生出更轻量、更快速的微调 API 产品,让非资深用户也能以更低的云端账单完成定制化模型训练。

值得关注的后续

1. 技术方案的扩散与分化。当前第一名使用序列打包和损失掩码,但项目已列出多个“尚未被采用”的技术方向(如不遍历所有数据、直接选择最具信息量的子集,或使用自定义 CUDA 内核)。若多从不同方向的方案同时达到相近性能,将揭示哪些技巧是真正普适加速器。

2. 更大规模模型的赛道扩展。项目目前仅约束到 1.5B-1.7B 参数级别,未来若开放更大模型(如 7B、13B)或其他任务类型(代码生成、指令跟随),排行榜对工业界的影响将更为直接。

3. 验证流程的可信度争议。当前验证依赖 Modal 固定沙箱和网络隔离,但若有人训练中使用验证集泄露、作弊的对抗手段(如通过特定种子绕过检),后续规则的演进和社区监督机制将成为长期观察点。

来源:Hacker News 热门(buzzing.cc 中文翻译)

celebrityanime
celebrityanime
文章: 14504

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注