page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

Amazon员工把AI用成“刷分器”:Token排行榜为什么注定会失控?

mogoec 2026-09-22 37

Amazon、Meta相继给Token排行榜踩刹车:企业为什么不能拿“斩首数”衡量AI能力

2026年,硅谷出现了一个很有时代感的新词:Tokenmaxxing

它的意思并不复杂:当企业开始用AI Token消耗量衡量员工是否“AI Native”、是否积极使用AI之后,一部分员工开始反过来优化这个数字——开更多Agent、塞更长的上下文、让AI执行原本几分钟就能人工完成的任务,甚至人为制造任务,只为了让Token消耗量看起来更漂亮。

于是,一个原本用于观察AI采用程度的技术指标,慢慢变成了一场新的“数字游戏”。

这并不是一个抽象的管理学假设。

2026年5月,《金融时报》报道,Amazon部分员工为了提高内部AI使用数据,开始使用公司的MeshClaw等工具执行额外甚至没有必要的任务。报道援引知情人士称,Amazon当时希望每周使用AI工具的开发者比例超过80%,公司内部也开始追踪Token消耗等数据。Amazon则强调,这些数据并非正式的个人绩效评价标准。

仅仅十几天后,事情出现了转折。

5月28日,《金融时报》进一步报道,Amazon关闭了一个名为“Kirorank”的内部排行榜。这个工具会按照员工使用Kiro开发平台的AI活动进行评分。Amazon向媒体表示,它只是由部分员工搭建的测试版工具,并不是正式获批的公司绩效系统。公司高级副总裁Dave Treadwell还要求员工不要“为了使用AI而使用AI”。

一个很典型的AI时代管理问题,就这样被暴露了出来:

企业真正想增加的是生产力,最后被员工优化的却变成了Token。

一场从Amazon蔓延到Meta的“Token竞赛”

Amazon并不是孤例。

2026年4月,《The Information》披露,Meta内部曾出现一个由员工自己开发的排行榜“Claudeonomics”。

它汇总超过8.5万名员工的AI Token使用情况,展示Token消耗最高的250名员工,并设计了“Token Legend”“Session Immortal”等带有游戏化色彩的称号。

当时披露的一组数据相当醒目:在一个30天统计窗口中,这个Dashboard记录的Token使用量超过60万亿,排名最靠前的个人用户使用量达到数千亿Token级别。需要特别说明的是,这些数字不能直接按照Anthropic公开API价格计算为Meta实际支出,因为Meta使用多种模型,也可能存在企业协议、缓存和内部基础设施等因素。

更重要的细节是:Claudeonomics并不是Meta官方推出的员工绩效排行榜,而是员工自建工具。

这也是很多二次传播文章容易忽略的一点。

排行榜曝光后很快下线。Meta随后表示,是创建这个工具的员工自行关闭了Dashboard,并非公司要求其关闭。

但真正值得关注的变化发生在几个月以后。

2026年9月,WIRED援引三名Meta员工报道,Meta已经向员工明确表示,绩效评价不再依赖员工究竟使用了多少AI工具。也就是说,从春天轰轰烈烈的Token竞赛,到秋天开始淡化AI使用量,企业内部对于“AI采用率究竟应该怎么衡量”的态度已经出现明显调整。

IBM在2026年9月发布的专题文章中,也把这种现象正式定义为“Tokenmaxxing”:企业把Token消耗或者AI使用量当成AI采用程度的代理指标,由此产生排行榜、最低使用量等激励,最终导致员工优化“使用量”本身。IBM的判断是,这股风潮在2026年春季达到高点后已经开始退潮。

为什么退潮?

因为管理者重新遇到了一个已经存在了半个世纪的问题。

Token排行榜踩中的,其实是古德哈特定律

经济学里有一条非常经典的规律,叫古德哈特定律(Goodhart’s Law)

英国经济学家Charles Goodhart在1975年研究英国货币政策时提出了最初的观察:当政府开始利用某个统计关系进行政策控制以后,这个统计关系本身就可能变得不再可靠。

后来,这个思想被概括成今天最广为流传的一句话:

“当一个指标变成目标,它就不再是一个好指标。”

严格来说,这句话是后来的通俗化表述,而不是Goodhart在1975年论文中的逐字原话,但它准确概括了这个问题的核心。后续研究发现,相似的“指标腐化”机制并不只发生在货币政策中,在教育、医疗、科研评价和企业管理中都能出现。

Token排行榜就是一个几乎教科书式的案例。

在没有绩效压力的时候,一个开发者每天消耗多少Token,可能确实能粗略反映他使用AI的程度。

但是,一旦管理层说:

Token越多,越说明你会用AI;

排行榜越靠前,越说明你AI能力强;

那员工的目标函数就发生了变化。

原来的目标是把工作做好

新的目标变成了把Token数字做大

于是,开十个Agent研究一个问题,比用一个Agent解决问题更“优秀”;让Claude阅读几十万字资料,比自己两分钟查到答案更“积极”;生成一个最终根本不会上线的Demo,也能留下漂亮的AI使用记录。

指标没有造假。

Token确实花掉了。

只是企业真正想要的价值,并没有同步发生。

两千多年前的秦国,其实遇到过同一类问题

有意思的是,如果把视线从硅谷往前推两千多年,中国古代的军功制度也能提供一个很好的对照。

很多人对秦国军功爵制的印象只有一句话:

斩首记功。

这种说法有事实基础。《商君书·境内》确实留下了非常明确的量化标准,比如攻城、野战对应不同的斩首数量要求。其他秦汉史料和相关学术研究也表明,斩获敌首与爵位、土地以及社会身份提升存在直接联系。斯坦福哲学百科对商鞅改革的介绍也指出,秦国低等级爵位的重要获得方式之一,就是军事功绩,尤其是斩获敌军首级。

但如果因此认为秦军就是“所有人统一按照个人斩首数排名”,反而把这套制度想简单了。

《商君书·境内》记载的实际规则比这复杂得多。

攻城和野战的军功门槛不同,百将、屯长等军官也存在与其所率部队战果相关的奖励标准。现代秦汉史研究进一步指出,一些并不直接执行斩首任务的军官、警卫和工程人员,他们的军事贡献也会按照相应规则转换为爵位奖励。

这里真正值得现代管理者借鉴的,不是“秦国会数人头”。

恰恰相反。

真正重要的是:一个组织必须区分不同角色产生价值的方式。

步兵的贡献、军官的贡献、工程人员的贡献,本来就不完全相同。如果为了管理方便,硬把所有人都塞进一个数字里,制度就会开始奖励错误的行为。

《荀子·议兵》谈到秦国军事制度时留下过一句很有名的话:“故四世有胜,非幸也,数也。”这里的“数”当然不是今天排行榜里的数字,更接近制度、方法和规律。秦军长期形成战斗能力,不只是因为士兵愿意拼命,也是因为奖励与组织目标之间形成了相对稳定的对应关系。

把这个逻辑放回2026年的企业AI管理,问题就非常清楚了:

Token相当于“斩首数”,而业务结果才相当于“打赢战争”。

如果最后只剩下数Token,手段就取代了目的。

AI真正放大的,是传统KPI的问题

实际上,Token排行榜并没有创造一种全新的管理错误。

它只是把旧问题放大了。

软件行业以前出现过类似的“代码行数崇拜”。

如果用代码行数评价程序员,那么一个本来20行就能解决的问题,写成200行反而可能得到更漂亮的数据。

加班时长也一样。

如果组织奖励“谁最后一个离开办公室”,最理性的员工行为可能不是提高效率,而是延长工作时间。

销售电话数量、论文数量、工单数量、会议次数,同样可能发生类似变化。

AI只是让这种现象变得更加明显,因为生成式AI能够极低成本地制造大量“活动”。

以前刷1000行代码还需要自己写。

现在一个Agent几分钟就能制造几千行代码、几十页分析报告和数十万Token记录。

所以,AI时代最不缺的已经是产出数量,真正稀缺的是有价值的产出。

Google Cloud旗下DORA团队在2026年3月发布的分析也指出,2025年调查中90%的技术从业者已经在工作中使用AI,超过80%的人认为AI提高了自己的生产力,但更高的AI采用率同时与更高的软件交付吞吐量和更高的不稳定性相关。换句话说,AI可以让代码生成得更快,却未必自动让最终系统质量变得更好。

DORA因此给出的建议非常明确:

Measure impact, not output——衡量影响,而不是单纯衡量产量。

这可能才是企业从“有没有用AI”进入“有没有用好AI”的真正分界线。

那么,企业到底应该怎样衡量员工有没有用好AI?

答案不是彻底停止统计Token。

Token仍然有价值。

它可以用于成本控制,可以判断工具采用情况,可以发现异常Agent,也可以帮助企业了解不同团队对模型的需求。

问题在于:Token应该是观测指标,而不应该直接成为终极绩效目标。

McKinsey在2026年4月提出了一套五层AI价值衡量框架,实际上很好地解释了这个区别。

最底层是模型本身的技术表现,包括延迟、幻觉率、Token成本和输出质量;往上才是员工采用程度,例如日活跃用户、工作流覆盖率、AI结果接受率;再往上是流程指标,例如周期时间、返工率、缺陷率和单笔业务成本;更高层是客户满意度、交付及时率、留存率等业务结果;最终才落实到收入提升、成本下降、利润率和总体拥有成本等财务结果。

这个框架有一个特别重要的含义:

“员工用了多少AI”本来就只是中间层指标,不是企业最终想要的结果。

比如,一个产品经理过去完成一份竞品研究需要三天,使用AI以后一天形成初稿,并把剩下时间用于用户访谈和关键判断。

真正应该记录的是研究周期缩短了多少、决策质量有没有提升,以及项目结果有没有改善。

一个客服团队使用AI后,真正值得看的不是调用了多少次模型,而是首次解决率有没有提高、平均处理时间有没有下降、客户满意度有没有恶化,以及每解决一个问题到底花了多少钱。

一个开发团队也一样。

真正有意义的数据不是“这个月烧掉20亿Token”,而应该是AI介入以后,Lead Time有没有缩短、部署频率有没有提高、生产事故有没有增加、返工率有没有上升,以及每个真正上线的功能到底付出了多少AI成本。

这样一来,Token就从“KPI”重新回到了它应该待的位置:

成本和过程数据。

2026年的企业AI,正在从“使用率”进入“价值率”

AI刚进入企业时,鼓励员工“先用起来”并没有错。

如果一个组织里80%的人从没打开过AI工具,那么周活跃率、使用次数甚至Token量,都可以作为培训和普及阶段的观察指标。

问题发生在第二阶段。

当员工已经普遍开始使用AI之后,企业仍然沿用第一阶段的指标,就会产生错位。

截至2026年9月,这种转变已经越来越明显。

Amazon关闭了Kirorank,并开始强调更接近实际代码交付的指标;Meta也开始淡化Token使用量在绩效评价中的作用。与此同时,企业AI讨论的重点正在从“多少人用了AI”,逐渐转向ROI、交付质量、成本控制和实际业务结果。

这可能是2026年企业AI落地过程中一个值得记录的节点。

过去两年,企业担心的是员工不用AI。

接下来真正棘手的问题,可能恰恰相反:

当所有人都开始使用AI以后,怎样判断哪些使用真正创造了价值?

Token排行榜最大的教训就在这里。

能被轻松统计的数字,往往最容易进入管理Dashboard;但最容易进入Dashboard的东西,并不一定最重要。

两千多年前,军功可以量化。

几十年前,工厂产量可以量化。

今天,Token同样可以精确到个位数。

但无论技术怎么变,组织最终都必须回答同一个问题:

你到底是在奖励指标,还是在奖励真正想得到的结果?

如果这个问题没有想清楚,那么AI时代一样会生产自己的“苏联钉子”。

只不过这一次,它们不再是一根根没人需要的铁钉。

而是服务器里那些确实被计算过、确实付过钱,却没有为任何人创造价值的Token。


关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部