微软叫停Tokenmaxxing!预算卡死,超限自负Microsoft Cracks Down on 'Token Maxxing'—Fixed Budgets, Overage at Your Own Cost
微软叫停Tokenmaxxing!预算卡死,超限自负 内部默认用GPT-5.6 听雨 发自 凹非寺 量子位 | 公众号 QbitAI 不是,连微软都开始心疼token了?? 根据内部邮件,从今年7月开始,微软已经为各业务部门设置了「AI TMicrosoft has set hard AI spending caps for each business unit starting this July; overages are now the unit's responsibility. Internally, GPT-5.6 is the default model.
📌 核心要点
- 根据内部邮件,从今年7月开始,微软已经为各业务部门设置了「AI Token预算目标」中文根据内部邮件,从今年7月开始,微软已经为各业务部门设置了「AI Token预算目标」
- 还将GPT-5.6设置为内部默认模型,原因是更便宜中文还将GPT-5.6设置为内部默认模型,原因是更便宜
- 从2026年7月起,微软各业务部门都有了「AI token预算目标」中文从2026年7月起,微软各业务部门都有了「AI token预算目标」
内部默认用GPT-5.6
不是,连微软都开始心疼token了??
根据内部邮件,从今年7月开始,微软已经为各业务部门设置了「AI Token预算目标」。
还将GPT-5.6设置为内部默认模型,原因是更便宜。
微软,那你这就是没见识过来自东方的神秘力量了。
要论便宜,你咋不直接上DeepSeek呢…
微软执行副总裁Jay Parikh也在内部亲自放话:
Tokenmaxxing不是我们优化的目标。
在微软,用AI也得勒紧裤腰带
根据Parikh的内部邮件和更新后的Copilot使用指南,微软新政可以拆成几条:
第一,设预算。从2026年7月起,微软各业务部门都有了「AI token预算目标」。
但具体的支出目标数值,目前尚未公布。
第二,看得见花费。员工可以查看自己的个人AI token支出。
内部数据显示,许多工程师每月token花费在几百到几千美元之间。
第三,换默认模型。内部默认模型从原来的选项切换为GPT-5.6,原因是比其他模型更便宜。
这还没完,微软表示,后续可能会根据监控情况施加进一步限制。
Parikh在内部邮件中说,「像管理其他所有关键资源一样管理token花费」。
他要求员工在用GitHub Copilot加速业务的同时,「每个人都应该意识到自己是如何消耗token的」。
其实这事儿也不是空穴来风。纳德拉6月份在一期播客上就说过,微软内部存在很多Tokenmaxxing。
甚至,他还承认自己也是个Tokenmaxxer,疯狂刷token,看着用量上高昂的数字,确实很上瘾。
但作为老板还是得算账。于是他又人间清醒了:生产率提升的边际收益,必须匹配token的边际成本。
不是每个问题都值得调用最强、最贵的前沿模型。模型跑得更久、上下文塞得更满、Agent开得更多,也不等于最终成果更好。
两个月后,这个判断就从CEO的播客发言,变成了微软的内部政策。
不过,微软员工倒是非常不满。一位员工表示:
一家在AI上重金投入、补贴了海量推理的公司,现在居然引导自家员工省钱??
这名员工的质疑相当尖锐:如果连托管AI基础设施的公司,都需要担心自己能否负担内部AI产品,那么购买这些服务的普通企业,又该怎么办?
Tokenmaxxing,大家都卷不动了…
Tokenmaxxing真正火起来,也就是最近几个月的事。
token+maxxing(刷到极致),跟gymmaxxing(猛练健身)、looksmaxxing(极致改造外貌)是同一套互联网造词逻辑。
不过,它并不形容某种自我提升,而是一种扭曲的激励——把AI用量当成了企业内部的KPI。
今年3月,Meta、OpenAI等公司的员工已经开始在内部排行榜上比拼token消耗量。
一些公司还将更高的token预算视为工程师福利,希望员工同时启动多个Agent,把更多工作交给AI。
到了5月,这股风吹到了亚马逊。
亚马逊内部搞了一个叫KiroRank的排行榜,按员工在自家AI开发平台Kiro上的AI使用量打分。
其实吧,公司的初衷大概是想鼓励工程师多用AI工具,用得越多,排名越高。
结果一些员工开始「刷榜」:让AI Agent执行没有必要或者价值很低的任务,只为提高使用量。token烧了不少,实际代码产出却没有同步增长。
月底,排行榜被关停。高级副总裁Dave Treadwell还专门提醒员工:
请不要为了使用AI而使用AI。
但类似的token刷量大赛,已经在几个月内风靡硅谷:
OpenAI一名员工曾一周处理2100亿tokens,足够把整个维基百科填满33遍。
Shopify和Meta也把AI使用纳入了绩效考核,奖励重度使用的员工,批评不用的。
Meta内部还曾出现名为Claudeonomics的员工自建排行榜,统计公司8.5万多名员工的AI使用情况。
里面不仅列出Token消耗最高的250人,还颁发「Token Legend」「Cache Wizard」等虚拟称号。
好家伙,这token版「英雄联盟」都出现了…
老黄也没少火上浇油。今年3月,黄仁勋在《All-In Podcast》中公开表示:
如果一个年薪50万美元的工程师每年消耗的token不到25万美元,我会深感担忧。
之后,在GTC 2026上,老黄又表示:
自己愿意在工程师几十万美元年薪之外,再提供相当于一半年薪的token预算,因为这些token有机会将工程师的能力放大10倍。
当然了,作为一个卖铲子的,工程师多烧一个token,AI基础设施就多一分需求。
老黄为Tokenmaxxing公开站台,多少带着一点朴素的商业立场。
但现在大厂们回过头来发现,事情有点不对劲了。
这不行啊,激励什么就得到什么。激励token用量,收获的是token泡沫。
404 Media发布的调查显示,Atlassian的月度AI支出在不到一年内增长至原来的三倍,超过1500万美元。公司随后开始设置支出限制,要求员工控制模型使用成本。
Uber的情况更夸张:整个公司到4月就烧光了2026全年的AI编程预算,Cursor给Uber提供的新一轮报价上涨至此前的4到5倍。
Uber随后规定,每名员工使用每一种Agent编程工具,每月不得超过1500美元。
从Amazon、Adobe、Atlassian到Citi,各家公司都开始收紧员工近乎无限的AI使用。共同解法就一个:简单任务别再默认调用最强模型,能降级就降级。
据相关消息,Citi曾要求员工按照任务难度选择模型,不要所有任务都使用最昂贵的版本;部分高成本模型一度被暂停访问。
Adobe也在取消员工对Claude的无限使用。
然而,钱还不是Tokenmaxxing留下的唯一问题。
有多名开发者表示,长期依赖AI之后,他们感觉自己的编程能力正在退化。
有人发现,自己越来越难判断一段代码究竟写得对不对;还有人担心,当成百上千名工程师同时提交大量AI生成代码时,根本没人有能力逐行检查其中的安全和质量问题。
那么,老板不看token消耗量了,以后看什么?
答案是:看工作成果。
比如Meta,从今年开始将「AI驱动的影响」列为员工的核心工作要求。它不再强调消耗了多少token,而是看员工能否利用AI产生实际影响。
当然,这套指标同样可能被形式化甚至被滥用。但与token排行榜相比,它至少试图回答一个更接近工作的基本问题:
你到底做成了什么?
在这波行业转向中,微软甚至算得上最后一批跟进者。
OMT
不过话说回来,硅谷想搞Tokenmaxxing,直接用DeepSeek就好了啊!!
用什么GPT-5.6、Fable 5,贵得离谱,也能怪Uber 4个月就能烧完全年所有预算…
诚挚安利老美程序员:
直接上DeepSeek V4 Flash,你蹬,你就只管蹬,公司破不了产。
参考链接:
[1]https://www.404media.co/microsoft-tells-engineers-tokenmaxxing-is-not-what-we-are-optimizing-for/
[2]https://www.404media.co/the-tokenpocalypse-is-here-companies-are-scrambling-to-stop-spending-so-much-on-ai/
[3]https://www.404media.co/software-developers-say-ai-is-rotting-their-brains/
[4]https://www.404media.co/companies-are-throttling-employees-ai-use-because-its-too-expensive/
[5]https://www.nytimes.com/events/hardforklive
- 老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了2026-08-05
- AI顶会现场,见到了一家美妆巨头2026-08-01
- GPT-5.6今起大降价,最大幅度80%!2026-07-31
- 一年连融三轮数亿元!字节+清华姚班,重构企业软件工程2026-07-30
Starting this July, Microsoft has imposed hard AI spending caps on each business unit, and any overage now comes out of that unit's own budget rather than being absorbed centrally. Internally, GPT-5.6 is the default model across the org. The move—colloquially called stopping 'Token Maxxing'—reflects a broader shift at big tech: after an experimental phase of free-spending AI adoption, finance teams want predictable unit economics. By fixing budgets and making overruns the unit's responsibility, Microsoft forces product teams to weigh model cost against value before scaling usage. It also signals how enterprise AI governance is maturing: not a ban, but a metered allowance with real consequences. Expect other large enterprises to follow with similar chargeback models as they move AI from pilots into core workflows.