🔥牛逼!让 Jev 自我优化、自己解决复杂问题,不用再手写 instruction、criteria、候选集! JevHarness:LLM 自动生成任务专属决策流程,冻结后每次只跑代码 + 快速 Jev 判断。有数据还能用轨迹持续进化。宝可梦 5 轮迭代,胜率 25% → 75%。 主要亮点: 🔹LLM 写一次策略,Jev 做高速模糊判断 🔹自动生成特征、问题、判据和动作逻辑 🔹可用奖励 + 全轨迹反射 / GEPA 自我优化 🔹自…

JevHarness 让大模型自己写出任务专属的决策流程,冻结后由轻量 Jev 模型做高速判断,宝可梦对战任务经 5 轮迭代把胜率从 25% 提到 75%。它的价值在于把“反复手写提示词和判据”的活交给 LLM,线上只跑代码加快速推理。

一句话看懂:JevHarness 让大模型自己写出任务专属的决策流程,冻结后由轻量 Jev 模型做高速判断,宝可梦对战任务经 5 轮迭代把胜率从 25% 提到 75%。它的价值在于把“反复手写提示词和判据”的活交给 LLM,线上只跑代码加快速推理。

事件核心:发生了什么

开发者 @NFT_Chen 在 X 上介绍了开源项目 JevHarness。它做的事情是:由 LLM 自动生成任务专属的决策流程,包括特征、问题、判据和动作逻辑;策略一旦冻结,线上每次只跑代码加一次快速的“Jev 判断”,不再调用大模型反复推理。若手头有奖励信号,还可以用全轨迹反射或 GEPA 做自我优化,持续迭代。公开演示的宝可梦对战任务中,经过 5 轮迭代,胜率从 25% 提升到 75%。

配套能力包括:Claude Code 的 skill 插件,添加 marketplace 并安装 jev-harness@jevharness 后,可直接对 Agent 说“用 JevHarness skill 按我的任务生成 harness”;项目自带 Coding Agent skill,给出仓库地址即可开工;还支持回放每一步 Jev 选择的对战 Demo。同账号此前还发布过 Jev 决策模型在 OpenRouter 上用 Ori Eval 跑 30 分类任务的结果,200 条合成数据下中位延迟 154ms、准确率 98.5%。

为什么重要

目前公开信息显示,Agent 落地的一个主要成本来自“每步都问大模型”——延迟高、Token 贵、结果不稳定。JevHarness 的思路是把“想清楚”和“做判断”拆开:LLM 负责生成结构化策略,轻量 Jev 负责高频模糊判断,大模型只在离线迭代时出现。这相当于给 Agent 做了一层编译,把昂贵的推理固化成一串可回放的决策规则。

对行业而言,这条路线和“把所有能力塞进一个超大模型”的思路形成对照。如果策略生成能自动化、评测能自动化,那么中小团队也能为垂直任务快速搭出低延迟、低成本的决策系统,而不必依赖闭源大模型的在线调用。开源加 Claude Code skill 的组合,也降低了从仓库到可运行 harness 的门槛。

对用户/开发者/创作者的影响

开发者可以把它当成 Agent 的“编译工具链”:先用 LLM 生成 harness,再用奖励信号迭代,满意后冻结上线,线上只承担 Jev 推理的成本和延迟。对于需要高频决策的场景——游戏 AI、风控规则、客服分流、内容审核——这套模式比每步调用大模型更可控。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

创作者和企业则要留意适用边界:JevHarness 依赖清晰的任务定义和可量化的奖励,宝可梦对战这类规则明确、反馈即时的问题适合,开放式创作或长链条推理未必同样受益。目前公开信息显示,效果数据主要来自演示任务,尚缺第三方在真实业务上的复现。

值得关注的后续

一是 Jev 模型本身是否开源、能否本地部署,以及在非演示任务上的延迟与准确率表现;二是 GEPA 等自我优化方法是否能稳定收敛,避免轨迹反馈把策略带偏;三是社区是否出现可复用的 harness 库,让“生成策略—评测—冻结”的流程标准化。若这三点成立,Agent 的成本结构会有实质变化。

来源:@NFT_Chen

celebrityanime
celebrityanime
文章: 24801

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注