一句话看懂:麦肯锡没有限制顾问使用 AI,而是按用户追踪 token 消耗,用量过高就发邮件提醒;这套“看得见消耗”的做法,正在成为咨询业和大型企业应对大模型按量计费的标准动作。
事件核心:发生了什么
麦肯锡英国 AI、数据与分析团队 QuantumBlack 负责人 Debasish Patnaik 向 Business Insider 介绍,公司今年夏天在全公司上线了 AI 使用告警系统:按用户逐一追踪 token 消耗,用量偏高时直接发邮件提醒。他把这比作公司手机流量超额提醒——不是禁止使用,而是让员工知道怎么用得更省。
据麦肯锡官方博客,到 2026 年 5 月,公司每月处理约 5 万亿个 token,且消耗高度集中:约 10% 的用户贡献了约 65% 的总量,重灾区是咨询顾问和软件工程师。今年 LLM 厂商普遍从订阅制转向按 token 计费的用量模式,OpenAI 9 月也披露,其最活跃的 AI 编程 agent 用户每天消耗的 token 价值超过 7000 美元。
除了邮件提醒,麦肯锡还部署了几层控制:内部 AI 网关在请求到达模型供应商前做优化;熔断机制在 token 用量异常时临时暂停访问,评估该用量是否产生实际价值;缓存让重复问题的答案可以复用,并把消耗成本在公司层面统筹,而不是锁死在单个账号的许可额度里。
为什么重要
过去一年,咨询公司和大企业都在鼓励员工尽快把 AI 用起来,现在它们开始面对规模化的账单。按 token 计费意味着推理成本与使用强度直接挂钩,谁能把消耗管住、又不压制生产力,谁就能在 AI 商业化的下半场保持利润空间。
麦肯锡的思路是透明加教育,而不是配额封顶。Patnaik 说这背后的逻辑是给顾问自主权,让他们看到自己的使用习惯后再自己调整。这种方式能否奏效,目前公开信息显示仍有待观察,但它至少提供了一条不同于“一刀切限流”的路径。
同行已在跟进类似治理。安永设立了“AI 价值实现办公室”,并在部分专用 AI 工具后面加装“隐形路由器”,把任务分发给最合适的模型,安永称该路由器等措施让 token 消耗自 4 月以来下降 60%。德勤美国一名高级软件工程师则抱怨 GitHub 定价调整“已经造成混乱”,开发者很快烧完新配额。咨询业在 AI 成本治理上的做法,很可能被它们原样打包卖给客户。
对用户/开发者/创作者的影响
对开发者而言,token 消耗正在从“看不见的云成本”变成可被追踪、可被问责的指标。企业内部网关、路由器和缓存会成为常见基础设施,写 prompt、选模型、复用上下文这些习惯会直接反映在账单上。对内容创作者和普通用户,按量计费意味着重度依赖 AI 生成、长上下文和 agent 自动化的场景成本上升最快,轻量、批处理、缓存友好的用法更划算。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业采购方,评估 AI 工具时不能再只看订阅价,还要看网关是否支持优化、能否观测人均消耗、有没有熔断和缓存机制。目前公开信息显示,麦肯锡内部 AI 支出尚未到失控阶段,其用途多集中在个人生产力和加速交付,成本收益仍偏向收益一侧,但 Patnaik 也承认,再过半年用量可能更夸张。
值得关注的后续
一是这类告警和熔断会不会影响实际产出,还是只改变使用方式;二是模型厂商的按量定价是否继续上调,把成本压力进一步推给企业;三是安永所说的 60% 降耗能否被独立验证,成为行业基准;四是麦肯锡这套内部治理会不会直接产品化,卖给正在为 token 账单发愁的客户。


