我花9美元让Gemini训练出了自己的替代品

一位开发者用 Gemini 3.1 Pro 花 9 美元标注了 4,290 条 Reddit 评论,再花约 24 分钟在一块 Tesla T4 上微调开源 NER 模型 GLiNER,得到 0.83 F1 的实体识别效果,成本约 0.0021 美元/条。这提供了一个"大模型当老师、小模型当学生"的低成本落地样…

一句话看懂:一位开发者用 Gemini 3.1 Pro 花 9 美元标注了 4,290 条 Reddit 评论,再花约 24 分钟在一块 Tesla T4 上微调开源 NER 模型 GLiNER,得到 0.83 F1 的实体识别效果,成本约 0.0021 美元/条。这提供了一个”大模型当老师、小模型当学生”的低成本落地样本。

事件核心:发生了什么

作者 Peter Vijeh 原本用 Gemini 3.1 Pro 逐条识别 Reddit 厨刀讨论中的品牌、型号和钢材,每条评论一次付费 API 调用。爬虫随发帖量增长,账单不可控,于是改用开源 NER 模型 GLiNER 零样本推理,成本归零但准确率掉到约 0.65 F1。

他的方案是让 Gemini 一次性标注 4,290 条评论(约 9 美元,25 分钟完成),再微调 GLiNER large v2.5(459M 参数)。关键工程决策是不让模型输出字符偏移量,而是输出实体字符串和标签,由 TypeScript 代码计算位置;并对 VG-10、CPM-154 这类含标点的型号做正则保护。约 30% 的训练样本是”有触发词但无产品”的负例。验证集在第二阶段前锁定为 225 条,此后不再改动。

结果:在 Tesla T4 上训练约 24 分钟,10 次尝试中有 5 次完全失败(3 次配置问题,2 次 words_mask 张量构造错误),最终对 Gemini 标签达到 0.83 F1。总花费约 9 美元标注 + 2.5 美元 GPU 时间,加上数天调试。作者也明确指出:标签没有人工校验,模型是在模仿 Gemini 的判断,而非对齐事实真相。

为什么重要

这条路径把”用闭源大模型做标注老师、用开源小模型做推理执行者”的成本结构摊开了:训练样本的边际成本可以降到千分之二美元一条,推理则回到自有 GPU 上,按算力而非按调用量计费。对高频、格式化、边界清晰的抽取任务,这是目前公开信息显示较现实的降本方式。1.7 亿参数级别的模型(此处为 459M)在特定子任务上逼近通用大模型的输出,也说明”通用能力”和”任务准确率”并非一条曲线。

对用户/开发者/创作者的影响

对独立开发者来说,这条流程的门槛主要不在钱,而在工程细节:HF Trainer 与 GLiNER 的配置陷阱、偏移量计算、分词边界、负例比例,都会直接决定训练是否收敛。作者给出的一条经验值得记下——让模型返回字符串、由代码算偏移,比让模型数位置可靠得多。对使用大模型 API 的团队,这意味着可以把”持续增长的分账单”换成”一次性标注 + 本地推理”,代价是前期调试投入和模型维护责任转移到自己身上。需要提醒的是,验证分数是相对 Gemini 而言的,真实场景的准确率取决于 Gemini 本身是否可靠。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这种”师生模型替换”是否会成为主流 API 降本做法,以及云厂商和推理平台会不会推出更简化的托管流程;二是 GLiNER 这类小型开源 NER 模型在多语言和长文本上的表现能否同步提升;三是当训练标签来自闭源模型时,标签质量审计如何做——目前公开信息显示,这仍是该方案最大的不确定项。

来源:Hacker News

celebrityanime
celebrityanime
文章: 24048

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注