OpenRouter 实测 LLM 图像输入 detail 档位:低清未必省钱
Choosing the Optimal Image Input Detail Level in LLMs
OpenRouter 在 MMMU-Pro Vision 上对 OpenAI 和 Google 五款模型的图像 detail 档位做了基准测试,发现 gpt-5.5 用 low 档比 auto 准确率低 13.8 分(65.2% 对 79.0%),每题成本反而更高(5.1¢ 对 4.5¢),因为模型靠多出 1.6 倍的推理 token 补偿降采样图像。
OpenRouter 用 MMMU-Pro Vision 实测图像 detail 档位与推理成本的关系,给出可迁移的调参取舍。
如果你为了降低成本而将图像输入的 detail: low 设为低,你可能得不到预期的改进。我们对 OpenAI 和 Google 最新模型的图像细节参数进行了基准测试,发现细节级别、推理和成本之间存在一些令人惊讶的关系。
例如,当我们在 MMMU-Pro Vision 上对 gpt-5.5 的 low 与 auto 图像细节进行基准测试时,低细节得分差了 13.8 分(65.2% 对 79.0%),而且每个问题的成本更高(5.1¢ 对 4.5¢)。模型通过多思考 1.6 倍来补偿降采样的图像。这些推理 token 的成本超过了输入上节省的图像 token。

我们发现,在推理模型中节省图像处理成本有一条更有效的路径:发送更清晰的图像(auto 或 high),并改为调整推理力度。
自动细节在每个模型上都能产生更好的结果,有时成本还更低
我们在 low 和 auto 两种设置下运行了来自 OpenAI 和 Google 的五个模型,温度 0,一个 epoch。每个模型在自动模式下得分都更高。

| 模型 | 细节 | 准确率 | 成本 / 问题 | 推理 token/请求 |
|---|---|---|---|---|
| gpt-5.5 | 低 | 65.2% | 5.1¢ | 1,180 |
| gpt-5.5 | 自动 | 79.0% | 4.5¢ | 730 |
| gpt-5.4-mini | 低 | 46.1% | 0.08¢ | 0 |
| gpt-5.4-mini | 自动 | 55.8% | 0.14¢ | 0 |
| gpt-4.1 | 低 | 40.1% | 0.43¢ | 0 |
| gpt-4.1 | 自动 | 57.5% | 0.66¢ | 0 |
| gemini-3.5-flash | 低 | 77.9% | 2.96¢ | 2,876 |
| gemini-3.5-flash | 自动 | 80.1% | 2.80¢ | 2,602 |
| gemini-3.1-pro | 低 | 75.5% | 9.53¢ | 6,344 |
| gemini-3.1-pro | 自动 | 78.4% | 11.12¢ | 6,964 |
低细节让 gpt-5.5 思考更费力
根据 OpenAI 的视觉文档,detail: low 会给模型一个低分辨率的 512x512 版本图像,无论原始尺寸如何,并按一个很小的固定 token 成本计费。虽然这节省了输入 token,但也意味着有用的精细细节可能在降采样中丢失。
在 gpt-5.5 上,低细节产生了 每次请求 1,180 个推理 token,而自动模式为 730 个,跃升 1.6 倍,另外完成 token 多了 39%(489 对 351)。模型把额外的精力花在眯着眼看那些它再也无法清晰阅读的小字和图表上。

输出 token 的计费高于图像 token,因此更便宜的输入成本被抵消了。同一个模型在低细节下问同样的问题,每个问题多花 0.6¢。你付了更多钱,得分却更差。
在推广之前有一点需要注意:token 模式因模型而异。gemini-3.5-flash 在低细节下也使用了更多推理 token(2,876 对 2,602),但 gemini-3.1-pro 使用的略少(6,344 对 6,964),而且它的低细节运行结果更便宜。
gpt-5.4-mini 和 gpt-4.1 不进行推理,因此它们在两种设置下都停留在 0 个思考 token。没有输出端增长,输入节省就得以保留(详见下文)。
更清晰的图像能带来多少准确率提升?
从低切换到自动带来了 2 到 17 个百分点的准确率提升,具体取决于模型。

OpenAI 模型获益最多,因为它们的低设置会将每张图像降采样到 512x512,并收取一个很小的固定 token 成本(gpt-4.1 上为 85 个 token)。Gemini 的低分辨率每个部分保留大约 273 个 token,因此它从一个更清晰的基线开始,损失更少。
这些提升集中在特定图像类型上。数据集 76% 是文本和 OCR,另有 19% 是截图,因此大多数问题已经接近模型的上限,几乎不随细节变化。最明显的跃升出现在图表和图形上:gemini-3.1-pro 在这些类别上从 78.6% 攀升到 91.7%(使用自动细节)。无论哪种方式,示意图仍然是最难的类别,正确率约为三分之一(基于 21 个问题的小样本)。

下面是其中一个问题,一张 2239×1279 的机械工程图,要求你从四个几乎相同的正交投影中选出正确的主视图:

这四个候选视图的区别仅在于阴影线和隐藏线的位置。在 auto 细节下,gpt-5.5 选择了 B,即正确答案。在 low 下,同一张图被压缩成 512px 的缩略图,那些细线变得模糊不清,模型经过更长的思维链后落在了 C 上。更长的推理并不能替代一张清晰的图像。
推理级别对成本的影响最为显著
细节级别和推理投入看起来作用相似,但在我们的运行中,它们的结果却大相径庭。改变细节级别使准确率波动 2 到 17 个百分点,而几乎不影响账单。改变推理投入使账单波动 50% 到 75%,而准确率仅在 1 到 2 个百分点之间浮动,属于噪声范围。

将 gpt-5.5 限制到 reasoning=low 后,低细节成本从每题 5.1¢ 降至 1.7¢,降低了 67%,而准确率变化了 1.3 个百分点(65.2% 到 63.9%)。在 gemini-3.1-pro 上,auto 运行从 11.1¢ 降至 2.7¢,准确率上升了 1.5 个百分点。所以,如果你想要更便宜的图像处理流程,就限制推理投入并保持图像清晰。
低细节在非推理模型上仍然划算
在非推理模型上,低细节的表现符合预期。gpt-5.4-mini 在 low 下每题运行成本为 0.08¢,而 auto 下为 0.14¢,便宜约 40%,因为没有推理循环来推高账单。代价是准确率,从 55.8% 下降到 46.1%。
延迟也呈现同样的趋势。gpt-4.1 在 low 下平均每请求 960ms,而 auto 下为 1,148ms;gpt-5.4-mini 则为 1,348ms 对 1,776ms。低细节将图像限制在一个很小的固定提示 token 成本内(gpt-4.1 上为 85 个 token),因此模型开始生成之前需要读入的内容要少得多。由于没有推理循环拖长尾部,更短的预填充就表现为更快的响应。
为你的工作负载选择合适的细节级别
选择取决于你的模型是否进行推理:
- 推理模型(gpt-5.5 及类似模型):保留
auto或high,并使用推理投入来控制成本。在我们的运行中,低细节在每个推理模型上得分都更差,并且在三个模型中的两个上成本更高。 - 非推理模型(gpt-5.4-mini 及类似模型):低细节可降低成本并减少延迟,但在文本密集的图像上准确率有所下降。
无论哪种情况,与更昂贵的输出 token 相比,细节设置对最终成本的影响要小得多。在大多数情况下,你最好将图像细节保持在 auto,并调整推理。
OpenRouter 的 图像输入 API 在各模型间是统一的,而像细节级别这样的模型特定参数通过提供商选项传递,因此你无需更改集成即可调整这些设置。
我们如何测试
- 基准:MMMU-Pro Vision(
MMMU/MMMU_Pro,vision 配置,测试集),1,730 道十选项视觉推理题。 - 模型:gpt-5.5、gpt-5.4-mini、gpt-4.1、gemini-3.5-flash、gemini-3.1-pro,每个均在
low和auto细节下,温度 0,一个 epoch。 - 细节:OpenAI
image_url.detaillow/auto;Gemini 按部分mediaResolution。无最大 token 上限。 - 图像类型:由 gpt-5.4-mini vision 分类(文本/OCR、截图、示意图、图表、插图、照片)。按类型准确率针对 Gemini 模型计算;本次运行中未对 OpenAI 的按类型单元格评分。
- 指标:准确率来自评估日志;token 和延迟来自 OpenRouter 生成记录。
- 成本:以每题成本报告,即总运行成本除以该次运行中评分的题目数量。这样归一化可以确保在规模略有不同的运行之间进行公平比较。
来源:OpenRouter Blog · openrouter.ai