品玩

科技创新者的每日必读

打开APP
关闭
业界动态

腾讯司晓:词元(Token)是智能时代最显性的脉搏

说明:本文为腾讯副总裁、腾讯研究院院长司晓在2026中国国际大数据产业博览会《词元——数据要素价值释放新路径交流活动》上的主题演讲实录。

鸠鸠

发布于 12小时前


说明:本文为腾讯副总裁、腾讯研究院院长司晓在2026中国国际大数据产业博览会《词元——数据要素价值释放新路径交流活动》上的主题演讲实录。

尊敬的各位领导,今天我给大家分享一下词元(Token)经济,或者说Token经济。通过后面几个案例,大家可能会更容易理解,为什么我选择“词元(Token)是智能时代最显性的脉搏”作为副标题。

我想先从一个案例开始。2023年3月,我带着团队去了解产业带,因为我们的视频号电商业务开始做微信小店。其中在浙江海宁的皮革城,我跟一位老板有过一段对话。我给他展示文生图能力时,他讲到一个困扰:好不容易请设计师、设计院设计了一个东西,别说放到网上卖了,只要挂到档口上,很快就会被人拍照抄走,爆款马上就没了。后来我用文生图给他生成了一些设计草图,他觉得这个东西很神奇,说:虽然我不会设计,但是我会挑。我在这个行业干了几十年,大概知道这一批里面挑哪个能火。所以当时我就有一个感觉:大模型卖的并不是模型本身,而是在这个场景里设计能力的智力服务。人类作为驾驶员,核心能力在于品位和选择。

刚才从几位领导的致辞到院长的发言,大家都提到了Token使用的爆炸式增长。我看到一组数据:2024年年初,全中国日均消耗Token数是1000亿;到了今年6月,我们公布的数据是日均500万亿,整体增长了5000倍。这里还有两个更直观的例子。第一个是Token Tracker。它是一个开源软件,安装在本地后,可以把各个AI产品的Token使用量统计加总。在它的排行榜上,第一名用户一个月消耗了1200亿Token。也就是说,这位国外技术大神一个人消耗的Token,相当于中国在2024年年初全国口径日均消耗量的1.2倍。

这个人我们不知道是谁,但我可以讲一个身边的文科生案例。一位坐在我办公室附近的文科研究员,最近三个月的Token消耗非常高。她是非常极致的使用者,自己的视频号内容几乎全由数字人完成。她有一天最高消耗17亿Token,从5月至今总量是308亿,日均2.8亿。按这个趋势,一个文科研究员一年也能用到1000亿Token的量级。这是真实发生的,我敢对数据真实性负责,因为它来自她的Token Tracker统计。还有一个关键数字,她的对话有20万轮,准确说是196,049轮。这一定不是普通的人机对话,而是Agent在背后有大量调用。她让Agent晚上跑多个任务,第二天早上一看,消耗了这么多,一定是这样的。

所以,Token消耗的爆发性增长首先来源于机器端,而不是人类的直接调用。这里可以分成三层。第一层是人类直接消耗。说白了,人的注意力和时间都有限,不可能直接消耗太多Token。真正的增量,一定来自工作流和长程任务:当机器端的AI能够持续执行3到16小时的任务,Token消耗才会快速上升。就像无人驾驶一样,人类整个行驶里程的增加,一定不是靠人开车,而是到机器能够自己开、汽车能够完全自动驾驶的时候,才会爆炸性增长。它的物理瓶颈会变成道路使用率问题。再怎么样,道路使用率决定了总里程上限。这和后面要讲的Token总量软硬件瓶颈有直接关系。粗略估计,每向上一层,消耗可能上升一到两个数量级,也就是乘以十或者乘以一百。大概是这样一种指数级消耗,能够解释刚才那两位超级个体为什么可以使用到那么多Token。

所以这里有一个结论。这个结论的形成,其实受到刘烈宏局长很大的启发。上次在江小涓老师组织的中国数字经济年会上,我有机会向烈宏局长请教了一个问题:到底怎么看Token能卖钱、大数据不一定能卖钱这个现象。他讲了一句话,Token本身能够商业化,恰恰证明了它是大数据变现的一种方式,是一个例证。这个判断给了我很大的启发。从数据来说,原始数据机器不能直接训练,需要先Token化,再用于模型加工;模型加工又通过GPU运转和电力消耗生产出Token,进而售卖智力服务,最终由客户付费。这样讲还是比较抽象。

我来讲一个具体例子。英伟达创始人黄仁勋曾讲过,整个Token的成本由五层蛋糕决定。作为“卖铲子”的一方,赚钱最多的是芯片那一层。现在大家也知道,存储HBM的价格很高,又拿走了其中一大部分。所以我们的结论是,利润会流向当前最难被替代的环节;而这个瓶颈一旦变化,整个利润分配也会跟着变化。我们现在面对的情况是:对于一个看起来像数据的产品,它的硬成本中有70%是硬件约束,由能源、芯片和基础设施决定;上面所谓算法的贡献,实际上只占20%,最多到30%。所以从这个角度,我甚至可以说得夸张一点:它像一个工业制品。每生产一个Token,就像生产一个螺丝钉一样,其中有很多硬性、刚性的东西。因此,它和我们讲的比特有非常根本的区别,和互联网时代的商业模式也有根本区别。

互联网模式的边际成本基本是零。你把软件研发出来,包括SaaS服务也是一样的,只要研发出来,多一个用户,多一个微信用户、多一个淘宝用户,没有多少成本。但AI不一样,多一个AI用户,用户消耗的每一个Token都有刚性成本,没有边际成本为零的效应。而且它还没有那么强的网络效应。什么叫网络效应?就是你在一个对话框里,可以随时切换到另外一个AI去进行对话。用户忠诚度非常低,哪个AI强、哪一块便宜,就马上切换过去。这是一个非常现实的例子。所以它的商业模式跟互联网时代一定不一样。

这里可以得出一个结论:Token的成本主体是物理性的、重资产的。AI看上去像软件,骨子里却越来越像重工业。

这里还有一个特别有意思的例子,就是AI有两个时钟的迭代效应。第一个时钟在软件侧,基本上按周,甚至按天迭代,这个说得一点都不夸张。从算法侧看,MoE、FlashAttention、KV Cache管理、连续解码等等,这里只是举一些大的变化,小变化基本上每周都会发生。这就是为什么在AI的排行榜上,某一个模型顶多在那里待个十天八天,没有各领风骚数百年,能各领风骚上十天都已经很牛了。在硬件约束的情况下,算法变化能够带来局部变化,但更关键的是物理侧。这个双时钟,你可以理解为两个齿轮:一个齿轮转得飞快,另一个齿轮的咬合使得它没有办法同样快,这另一个齿轮就是物理侧约束。比如HBM扩产大概要12到18个月。从GPU来讲,每年都会有GPU发出来,但GPU发出来之后,总不可能把之前的GPU就扔了。从这一代GPU出来,到下一代GPU部署下来,至少要18个月到两年。数据中心的建设是18到36个月。变压器这个行业的人都知道,中国生产变压器的能力也是非常强的。变压器大概是2.5年,电网是5到12年,这实际上甚至是我们相对于美国的一个优势所在。

时间有限,更多物理侧的细节我们就先不展开了。这里想强调的是,AI的需求可以被软件快速拉高,但供给侧的硬件和能源不可能同步加速,HBM、GPU、数据中心、变压器、电网都有自己的建设周期。就像自动驾驶的道路,车越来越聪明、跑得越来越快,但道路容量是给定的,最终能跑多少里程,仍然受路网承载能力约束。理解了这一点,后面谈AI的商业模式,就不能只按互联网软件的逻辑来算账。

接下来是商业模式的基本推演。它从卖Token开始,是一个价值光谱。这个价值光谱的捕捉取决于商业模式设计。从最基础的按量收费、直接卖Token,到订阅制、积分制,再到按照工作流或者结果付费,以及更大授权下按照数字员工的方式订阅一个服务。从平台风险到获客单价,再到智能体复杂度,都会随之变化。

我们可以先看几个增长案例。Anthropic从2023年到2025年实现了年对年(year-on-year)十倍的收入增长。不要说在互联网历史上,即便放在人类商业史中,也很少看到一家企业在人员规模没有大幅膨胀的情况下实现一年十倍增长。这就是AI时代卖API的直接模式。其中,Claude Code年化收入超过25亿美元;Cursor约300人的团队,大概24个月年化收入超过20亿美元。我们的CodeBuddy和WorkBuddy,在工程师覆盖和增速上也都很快。

由此可以看到,模型可能决定上限,但工作流,包括Harness这一套,决定留存和变现。模型本身没有那么强的网络效应;但Harness这一套,Cursor也好,CodeBuddy也好,WorkBuddy也好,作为连接模型、工具和工作流的产品外壳,反而会产生忠诚度。因为用户会形成对软件界面的习惯,团队也会围绕类似产品协作,它就会沉淀出一些网络效应。这也是现在Harness这么火的原因。

这里还要讲一个例子。之前内部有Token Maxxing的比赛,也就是说谁烧的Token最多,谁就更有战斗力,这是一种简单粗暴的评价模式。背后是卖铲子的黄仁勋前面讲过一句话:如果一个员工一年有50万美元薪水,一年用不到25万美元的Token,你就是一个不合格的开发者。当然,站在卖铲子的立场上,他有鼓励大家多用的动机。所以中间一度出现一个现象:大家都追求Token消耗排行榜,结果有员工开始作弊。现在我们已经进入比较理性的阶段。CEO拿到账单之后,一定会问:Token账单涨了这么多,你们个人提效了,公司的收益在哪里?这和前面院长讲的是一样的。历史上也发生过类似情况:技术很牛,讲起来很热闹,结果GDP上看不到,公司的账单和报表上也看不到,但支出是切切实实发生的。

所以,任何负责算账的公司,都不会允许员工不受约束地使用。因为免费模式下,经济学上一定没有节约约束。如果公司买账单,成本由公司承担、产出归个人,就一定会导致个人过度消耗,甚至变成表演。这里更理性的逻辑,也是现在所有Agent产品都在进行的另一种竞争,就是我们讲的驾驭工程。模型是一匹马,马再强,直接坐在上面也没那么舒服,确实能跑、能问答;更好的方式,是给它套上好的马鞍、脚蹬,或者马车,然后坐在上面开起来才更舒服,跑得更稳,拉得更多。所以这一套就是WorkBuddy在做的Harness。用户意图理解等细节,这里不展开。WorkBuddy能够接入包括竞争对手在内的很多模型。除了我们刚刚上线、目前还在限时免费的混元4,从GLM到Kimi等等,我们都可以接入。所以在一个对话框里,用户可以不停切换模型。

刚好8月28日,我们发布了自己的混元4,我这里也给大家简单讲一下。前面大家可能觉得腾讯在整个AI发展过程中,坦率说,不算太领先,并没有太多刷屏的模型。我们整体确实走过一些弯路,但是更重要的是,作为一个服务十亿级产品的公司,性价比是最重要的。对我们来说,刚才讲的Token像工业制品。未来会有多少人用到微信里的小微?它在微信里的入口可能很轻,甚至只是两个小点点。不光是成本问题,我们也要把体验打磨好;更重要的是,我们希望生态里的小程序,不是我们直接调用别人,而是要跟别人商量好,才能用别人,我们走的是生态共赢的路线。以混元4为例,它是770B总参数、49B激活参数;到微信场景里使用时,模型会进一步变小。尺寸更小,能力可能会弱一点,但每一个用户的成本会更低。这样我们才有可能在免费的情况下服务十亿级用户。所以我们讲普惠,一定是算得过账的。在那个场景下,成本最优、智能最优、相互匹配的方案,才是我们追求的。

再给大家一个直观例子。今天演讲用的这份PPT,我也特别让同事去统计了一下。它是人机深度协作完成的,并不是AI直接生成,但是用了65万Token是比较确定的。我们的统计方式,是在做完PPT之后反过来问WorkBuddy:如果用接入的、等效的这些模型,大概估算一下会花掉多少钱。因为我们用了一个汇率,也用了一个积分(credit)的模式。刚才我讲的credit,意思是用户可以选择。从用户角度,最省事的是用Auto,不用管哪个模型。在产品界面上,不同模型旁边标的“乘以多少”,可以简单理解为汇率,因为这个模型的API本身有不同价格。

一个好的产品不应该让用户去算账,而应该把模型路由模式、Auto模式设定好。如果我着急,就用极速模式;但极速模式一定是干得快、消耗得快。如果我不着急,比如晚上睡觉,就用更省的模式慢慢干。它调用的模型以及推理速度,都会决定整个消耗。产品要做的,就是把这些计算隐藏在后台,减少用户自己算账的负担。

进一步说,个人提效、Token消耗,一定不等于组织整体绩效。为什么呢?其中有一块要靠组织变革。这个我还没有进行大范围商业测试。虽然我们团队做了《从超级个体到超级团队》这样一个报告,但是从我们作为智库机构来讲,研究院有50个研究员,我现在已经做了一个比较彻底的调整,先从原来的科层制里走出来。法律、经济、产业、文化、国际,是我们研究院上半年的架构,或者说过去十几年的架构;现在我已经把原有组织边界打散。所有研究员以AI Hub为中心,就像一个圆一样,通过AI Hub连接起来。而且里面所有开发都是我们自己的同事完成的,所有研究员都可以贡献AI Hub的功能。所以从项目A到项目B,就变成了以AI Hub临时组队、任务制协作的模式。我觉得对于智库,或者对于公司的研发团队,大家想的事情是不约而同的,都在往同一个方向变。这样变的一个好处,就是不需要再承担科层制的信息损耗,因为AI可以增强连接和协作能力。所以整体来说,我们从知识问答,到办公智能体,再到数字员工,就能看到刚才讲的智能服务光谱,以及商业模式的演进。

我们最近也跟数研院达成了类似数字员工的合作。这里不是做广告,而是因为我们写的《Token经济:当智力成为一种可计量的服务》这本书刚刚出版。我刚才讲的所有观点,都在这本书里面。关于此书的推荐语,我觉得腾讯公司董事会主席兼首席执行官马化腾先生讲的两句话很好。第一,Token是机器智能的最小单元,是不可切割的最小单元,也是智能时代最显性的脉搏。就像互联网时代我们看的是另一个指标,这个我觉得跟刚才两位领导的发言是不谋而合的。

第二,马总认为,技术的价值在于创新,更在于它被普通人用上。能不能有更多个人和组织用得上、用得起、用得放心,才是AI普惠真正要回答的问题。这也是为什么我们在AI时代,在延续科技向善理念的基础上,提出腾讯的AI观:让人放心、把人放大。当然现在还是研究院提出和探索的阶段,还没有经过马总首肯,但我觉得作为一个智库机构,我们可以先去思考一些更前沿的问题。

好,我的分享就到这里,谢谢大家。

下载品玩App,比99.9%的人更先知道关于「业界动态」的新故事

下载品玩App

比99.9%的人更先知道关于「业界动态」的新故事

iOS版本 Android版本
立即下载
鸠鸠

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测