一句话看懂:Floatboat 用市面上最便宜的模型 DeepSeek-V4-Flash 作底座,在五项第三方 Agent 基准上全部超过价格贵 57.1 倍的 Claude Opus 4.8。它想证明:Agent 的胜负手不只是模型,而是模型之外那半套系统——Harness。
事件核心:发生了什么
2026 年 8 月 7 日,AOE Tech Labs 旗下 Floatboat 公布了 Floatboat Harness 的完整基准评测报告。测试底座采用官方 API 定价的 DeepSeek-V4-Flash,按 Agent 场景典型 3:1 输入输出比折算,混合价为 $0.175/百万 token;对照方是 Claude Opus 4.8,混合价 $10/百万 token,前者只有后者约 1/57 的成本,却在五项第三方基准上全部超过对方。
这并非一次模型对比。此前 Floatboat 已通过三条产品线交付同一层技术:1 月 Floatboat 客户端将文件管理器、编辑器和浏览器做成 Agent 运行环境;4 月 FloatIM 打通人与 Agent 的任务交接网络;5 月 FloatSchedule 让 Agent 按日程自主开工。这一次,底层 Harness 被单独拿出来接受计量。
为什么重要
行业公认的等式是 Model + Harness = Agent,但长期以来,模型一侧被反复评测,Harness 一侧——模型能访问什么工具、每轮循环如何收敛、状态存于何处——没有公开可比的尺子。Floatboat 这次做的事,是第一次把 Harness 单独放到第三方基准上,连底座都选用任何人都能调用的低价公开 API,排除模型本身的变量。
如果结论成立,意味着“能干活的模型太贵、便宜模型干不动活”这一行业默认权衡可能被打破,且打破它的不是某个新模型,而是系统层面的设计能力。这对大模型商业化的定价逻辑、以及 Agent 产品的竞争重心都会产生直接压力。
对用户/开发者/创作者的影响
对开发者和企业技术决策者,如果 Harness 层能稳定提升低价模型的 Agent 任务表现,API 选型和算力成本结构可以大幅调整,Agent 应用的边际成本可能下降一个数量级。对普通用户,最终看到的是同等能力下更便宜的 AI 工具,或同等价格下能力明显更强的产品。对创作者,涉及批量、多步骤、跨工具的工作流,这类底层能力提升会直接反映在自动化工具的可用性上。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Floatboat Harness 是否会作为独立产品开放,还是继续只以内嵌于 Floatboat 产品线的方式交付;二是 DeepSeek-V4-Flash 这种低价模型搭配强 Harness 的组合,能否在更长任务链、更多轮交互中保持稳定性;三是其他 Agent 厂商是否会跟进,把 Harness 层作为可单独评测、单独售卖的能力。目前公开信息显示,完整评测报告已发布在 Floatboat 官网,但具体基准名称与测试方法学细节仍有待进一步核对。


