把 GLM-5.3-Flash 打造成类 Jev 的决策模型

开发者把通用大模型 GLM-5.3-Flash 改造成“单次前向传播即可输出带概率的分类决策”的模型,在准确性和速度上与专用决策模型 Jev 相当,还额外支持图像输入。

一句话看懂:开发者把通用大模型 GLM-5.3-Flash 改造成“单次前向传播即可输出带概率的分类决策”的模型,在准确性和速度上与专用决策模型 Jev 相当,还额外支持图像输入。

事件核心:发生了什么

Privatemode 的 Marko Rosenmüller 发布实践文章,介绍如何让一个现成大模型在单次前向传播中完成“类型化决策”。做法并不复杂:把状态、问题和候选选项以 JSON 形式写入提示词,为每个选项编号,并让提示词以 choice_index: 结尾进行预填充。模型随后只生成一个索引 token,但真正被读取的不是这个 token 本身,而是模型在该位置对整个候选选项集合给出的概率分布,归一化后即为每个选项的置信度。

该方案在 Privatemode 上运行的 GLM-5.3-Flash 上实现,通过 vLLM 的 /chat/completions 接口配合 continue_final_message 与 add_generation_prompt: false 完成。在基于公开数据集构建的基准上,其决策正确率与速度与 TypeSafe 的 Jev 相当;额外优势是能结合图像做类型化决策,这是 Jev 做不到的。文章同时提供了一个浏览器内的 playground 演示,答案通常在数百毫秒内返回,且输入端到端加密。

为什么重要

很多软件调用大模型的场景本质是决策,比如工单该分给哪个团队、合同条款是否属于责任范围。常规做法要求模型输出完整 JSON,推理模型还可能先“想”几百个 token,成本高、延迟大,而且拿不到置信度,难以用于高吞吐场景。Jev、Laya 这类专用“System One”决策模型正是为解决此问题而生,代价是它们需要专门训练。

这项工作的意义在于:不微调、直接用出厂模型,就能逼近专用决策模型的效果。对大模型应用层来说,它把“决策”从生成任务里剥离出来,只读取 token 概率,显著省算力、降延迟,并天然附带置信度——这为大规模自动化决策和“是否转人工”提供了可量化的依据。目前公开信息显示,该结论基于作者自建基准,尚不代表广泛的第三方验证。

对用户/开发者/创作者的影响

对开发者,这是可直接复用的工程模式:用 prompt 编号选项、预填充答案前缀、读取 logits 概率,即可在现有推理框架上实现分类决策,无需训练新模型。置信度分布可用于设置人工复核阈值,适合客服分流、内容审核、文档归类等高并发场景。对产品团队,图像输入能力意味着扫描件、发票等视觉决策也能纳入同一套接口。对普通用户,最直接的变化是这类 AI 决策会更快、更便宜,并更可能在被问到时给出明确把握程度。需要注意的是,作者提到模型能解出多数经典陷阱题,但并非全部,说明鲁棒性仍有边界。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是该方案是否会在更多模型和推理框架上复现,基准能否被第三方独立验证;二是它与 Jev、Laya 等专用决策模型在成本、延迟、准确率上的长期对比;三是这种读取概率分布的做法能否稳定扩展到图像和多步决策,以及置信度校准是否可靠。这些将决定它只是工程技巧,还是能成为决策类 AI 应用的通用范式。

来源:Hacker News

celebrityanime
celebrityanime
文章: 25815

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注