在LLM中选择最佳图像输入细节级别

OpenRouter 最新基准测试发现,在 GPT-5.5 等推理模型中,使用“低细节”(low)图像输入不仅会大幅降低准确率,反而可能因为模型“费力思考”而增加推理成本。清晰的图像配合降低推理努力,才是更优的省钱策略。

在LLM中选择最佳图像输入细节级别

一句话看懂:OpenRouter 最新基准测试发现,在 GPT-5.5 等推理模型中,使用“低细节”(low)图像输入不仅会大幅降低准确率,反而可能因为模型“费力思考”而增加推理成本。清晰的图像配合降低推理努力,才是更优的省钱策略。

事件核心:发生了什么

OpenRouter 于 7 月 7 日发布了一项针对 OpenAI 和 Google 最新多模态模型的图像细节参数基准测试。测试覆盖了 GPT-5.5、GPT-5.4-mini、GPT-4.1、Gemini-3.5-Flash 和 Gemini-3.1-Pro 五款模型,在 MMMU-Pro Vision 数据集上对比了“低细节”(low)与“自动细节”(auto)模式的表现。结果显示,所有模型在“自动细节”下准确率更高。以 GPT-5.5 为例,低细节模式下准确率仅 65.2%,而自动细节达到 79.0%;更反直觉的是,低细节模式每问成本为 5.1 美分,反而高于自动模式的 4.5 美分。

为什么重要

这一发现挑战了业界普遍存在的“降低图像分辨率等于省钱”的直觉。核心原因在于推理模型(如 GPT-5.5)在接收到模糊图像时,会动用大量推理 token 去“猜测”图像内容,导致推理成本激增——低细节下 GPT-5.5 的推理 token 数(1,180)比自动细节(730)高出 1.6 倍。这说明,在图像密集型 AI 应用中,粗暴的成本控制策略可能适得其反。对于 AI 服务的开发者和 API 采购者,理解“图像清晰度-推理成本-准确率”之间的非线性关系,将成为优化预算的关键。

对用户/开发者/创作者的影响

  • API 开发者:如果正在使用 GPT-5.5 等推理模型处理包含图表、截图或小文字的图片,切勿默认设为“low”以节约 API 开销。更好的做法是保持清晰的图像(auto 或 high),同时通过参数限制推理努力水平(如 reasoning=low)。OpenRouter 的数据显示,这一组合可将 GPT-5.5 的成本从 5.1 美分降至 1.7 美分,准确率仅下降 1.3 个百分点。
  • 内容创作者与产品经理:在涉及 OCR(光学字符识别)或技术图表识别的应用场景中,低细节可能导致用户体验断崖式下降。尤其是机械工程图、数据图表等细粒度内容,低细节下识别准确率降幅可达 10 个百分点以上。
  • 非推理模型用户:对于 GPT-4.1 或 GPT-5.4-mini 这类不支持长链思考的模型,“low”模式仍能实现输入成本节省,但因输出 token 较少,准确率损失也需要权衡。

值得关注的后续

第一,OpenAI 和 Google 是否会针对这一评测结果调整 API 文档或默认参数建议,值得跟踪。第二,当前数据集以文本和 OCR 为主(占 76%),图表和图表部分对细节敏感度最高,未来多模态 benchmark 可能需要更精细的图像类型拆分。第三,这一规律是否会推广到即将发布的 GPT-6 系列或 Gemini 下一代模型,目前公开信息尚未披露,但推理模型的“思考代价”将成为定价设计的长期变量。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:OpenRouter:Announcements(RSS)

celebrityanime
celebrityanime
文章: 15950

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注