快速结论:这个报错出现在 LiteLLM 成本映射中 Azure DeepSeek-V4.1-Flash 的 Direct 与 Fireworks 两条路径价格被错误地使用同一套 Fireworks 零售价时;优先确认你用的 LiteLLM 版本是否已包含 #43566,并检查 model_prices_and_context_window.json 中两条 key 的单价是否已恢复为各自独立计费。
适用环境:Issue 已确认的工具为 LiteLLM;涉及价格文件 model_prices_and_context_window.json 与备份文件 model_prices_and_context_window_backup.json,模型为 azure_ai/deepseek-v4.1-flash 与 azure_ai/FW-DeepSeek-V4.1-Flash;上游验证基于 main 提交 096b20b6db。Issue 未提供操作系统、Python、CUDA、显卡或具体依赖版本,无需额外补写。
最快修复方案:升级到已合并 #43566 的 LiteLLM main / 对应发布版本。该修复已合并到 main,恢复 Direct 路径价格为 $0.30 输入、$1.20 输出、$0.006 缓存输入(每百万 token),Fireworks 路径保留 $0.375 输入、$1.50 输出、$0.008 缓存输入(每百万 token)。
注意事项:#43566 合并于 2026-09-28,Issue 在 2026-10-06 于上游 main 提交 096b20b6db 验证通过。如果你使用的是已发布版而非 main,需要确认该 tag 是否包含此提交;若未包含,仍需等待对应版本发布或临时按上述数值修正本地成本映射。Issue 明确当前 Azure 零售价以 2026-10-06 的 Azure Retail Prices API 为准,后续价格可能变动。
问题场景
用户在 LiteLLM 中调用或统计 Azure DeepSeek V4.1 Flash 时,发现 Direct from Azure(azure_ai/deepseek-v4.1-flash)与 Fireworks on Foundry(azure_ai/FW-DeepSeek-V4.1-Flash)两个 key 在成本映射文件中被写成完全相同的价格:$0.375 输入、$1.50 输出、$0.008 缓存输入(每百万 token)。这导致 Direct 部署按 Fireworks 零售表计费,输入和输出约高 25%,缓存读取高约三分之一。该问题出现在 LiteLLM 的成本计算与用量统计环节。
报错原文
[Bug]: Azure DeepSeek-V4.1-Flash cost map prices both Foundry paths from the Fireworks meter
azure_ai/deepseek-v4.1-flash and azure_ai/FW-DeepSeek-V4.1-Flash are priced identically in model_prices_and_context_window.json and in litellm/model_prices_and_context_window_backup.json: $0.375 input, $1.50 output, $0.008 cached input per 1M tokens (3.75e-07, 1.5e-06, 8e-09 per token)
That is the Fireworks retail meter, copied onto the Direct from Azure key as well.
原因分析
最可能的原因是成本映射文件在录入 Azure DeepSeek-V4.1-Flash 时,把 Fireworks 零售表(product Azure Fireworks Models,单位 1K)的价格同时赋给了 Direct from Azure 的 key。Azure Retail Prices API 中 Azure Deepseek Models 当时没有 V4.1 Flash meter,因此 Direct 路径没有独立价格可供映射,于是复用了 Fireworks 的单价。结果是 Direct 部署被按 Fireworks 价格计费,产生约 25% 的输入/输出偏差和约 33% 的缓存读取偏差。
环境排查
- 确认 LiteLLM 版本是否包含 PR #43566,或当前是否运行在上游 main 提交
096b20b6db之后。 - 检查
model_prices_and_context_window.json中azure_ai/deepseek-v4.1-flash与azure_ai/FW-DeepSeek-V4.1-Flash两条记录的input_cost_per_token、output_cost_per_token、cache_read_input_token_cost。 - 检查备份文件
litellm/model_prices_and_context_window_backup.json是否与主文件价格一致。 - 如本地有自定义成本映射,确认是否覆盖了上游修复后的数值。
- Issue 未提供操作系统、Python、CUDA、PyTorch、显卡或节点信息,无需针对这些项排查。
解决步骤
- 将 LiteLLM 升级到包含 PR #43566 的版本。该 PR 已于 2026-09-28 合并到 main。
- 升级后检查
azure_ai/deepseek-v4.1-flash的价格应为 $0.30 输入、$1.20 输出、$0.006 缓存输入(每百万 token)。 - 检查
azure_ai/FW-DeepSeek-V4.1-Flash的价格应保留 $0.375 输入、$1.50 输出、$0.008 缓存输入(每百万 token)。 - 同步确认
model_prices_and_context_window.json与model_prices_and_context_window_backup.json两份成本图一致。 - 若当前版本尚未包含该修复,可优先尝试手动按上述 Direct 价格修正本地成本映射,并注意后续升级时不要被旧映射覆盖。
验证方法
在修复后的环境里分别对 azure_ai/deepseek-v4.1-flash 和 azure_ai/FW-DeepSeek-V4.1-Flash 发起一次计费统计,核对返回的成本值是否与各自单价一致:Direct 为 $0.30 / $1.20 / $0.006,Fireworks 为 $0.375 / $1.50 / $0.008(每百万 token)。同时确认 model_prices_and_context_window.json 中两条记录不再相同。Issue 的验证方式是核对上游 main 提交 096b20b6db、已合并的 PR #43566,以及 2026-10-06 的 Azure Retail Prices API meter。
参考来源
BerriAI/litellm commit 096b20b6db
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。
![[SAP provider] cache_control is stripped from messages — Anthropic prompt caching unusable](https://www.chat-gpts.plus/wp-content/uploads/2026/10/34797-cf3f6cac-768x403.jpg)

