最近,有读者发来一条智谱的公告。
用了几个月的老套餐,要没了。
此前那个“不限周额度”的GLM Coding Plan,将停止自动续订,智谱给老用户补偿两个月新套餐。几个月前,AI编程市场还在比谁家套餐更便宜;到了现在,大家开始比另一个东西:
你到底能用多少Token。
9月2日,智谱正式入驻天猫,开设官方旗舰店,上架GLM Coding Plan。个人版Lite月付118元、Pro月付538元、Max月付1078元,分别对应不同的积分额度;产品基于GLM-5.3,并适配ZCode、Claude Code、Codex等20余款主流Agent。
这意味着,一件过去听起来非常“技术”的东西,开始进入电商货架:
AI的使用额度,可以像手机流量一样被直接购买。
但这里真正值得关注的,并不是“智谱上天猫卖Token”这件事本身。
而是一个看起来有些反常识的变化:
Token越来越便宜了,AI公司却开始越来越在意你用了多少Token。
大家都开始限量了
过去几个月,AI行业出现了一个非常有意思的变化。
Kimi曾因为算力压力暂停C端新用户订阅。7月19日,月之暗面公告称,Kimi K3上线后请求量大幅超出预期,已经逼近现有集群承载极限,因此暂停C端新用户订阅,把算力优先留给已经付费的用户。
阿里云也在调整Coding Plan。其Lite套餐从3月20日起停止新购,4月13日起停止续费和升级。
腾讯云则在3月调整部分混元模型价格。其中,HY2.0 Instruct输入价格从每千Token 0.0008元提高到0.004505元,涨幅超过460%。
AI为什么突然不再“大方”了?
过去20年,互联网产品给人的最大经验是数字化之后,边际成本会越来越低。
手机流量就是最典型的例子。基站、光纤和网络基础设施建好以后,多传1GB数据的边际成本非常低。随着基础设施规模扩大,流量价格一路下降。
所以很多人自然会把这套逻辑套到AI上,芯片越来越强,模型越来越高效,单位Token的推理成本越来越低,那么AI应该越来越便宜。
事实上,这个判断的前半句完全正确。
智谱自己披露,随着模型架构和推理基础设施持续优化,其单位Token推理成本较年初下降80%。公司还称,目前已经实现10万级国产芯片规模化低成本推理。
问题在于,Token便宜了,但Token的消耗速度增长得更快。这才是今天AI行业真正的矛盾。
Token不是普通的数据流量。
一枚Token背后,是模型推理所消耗的计算资源,是GPU或AI加速芯片、高带宽内存、网络、存储,以及数据中心里的电力和散热。
Token更像是AI算力被计量、被交易的一种单位。
当模型只是陪你聊天时,一次调用可能只需要几百、几千Token。但当你让AI替你完成一个复杂任务,它的消耗就完全不同了。
从“卖模型”到“卖调用”
智谱最新半年报,把这个变化写在了财务数据里。
2026年上半年,智谱实现营收9.54亿元,同比增长399.7%。上半年,智谱MaaS开放平台及API业务收入达到8.25亿元,同比增长2735.7%,占总收入的86.5%。
而去年同期,这一比例只有15.2%。与此同时,本地化部署收入占比从84.8%下降到13.5%。
一年时间,智谱的商业模式几乎完成了一次换挡。
过去,客户买的是模型。模型部署到企业自己的服务器里,进行定制、集成和交付,一次项目往往对应一次收入。
现在,越来越多客户直接调用云端模型。调用一次,计一次费,用得越多,付得越多。这就是典型的MaaS生意。
而且,智谱这次的变化并不是简单的“降价换规模”。恰恰相反,它出现了一个很有意思的组合:
Token调用量较年初增长超过40倍;API平均售价提升约101%;单位Token推理成本下降80%;MaaS业务毛利率提升至24.6%。
成本在下降,收入在增长,用户用得更多,平均售价反而还在提升。AI商业化可能正在摆脱最初那种简单的“价格战”。
早期模型能力不够强,平台只能通过低价甚至免费,把用户吸引进来。
但当模型开始能够真正完成代码生成、工具调用、持续执行等复杂任务后,用户购买的就不再只是“一个模型”,而是模型替自己完成工作的能力。
这也是为什么智谱管理层把商业模式概括成了一条很有意思的路径:卖模型→卖调用→卖订阅→卖端到端任务结果。
这四步,其实对应着AI商业化的四个阶段。
智谱真正想卖的根本不是Token
过去是Chatbot模式:你问一句,它回答一句。一次可能只需要几百、几千Token。
现在是Agent模式:你说“帮我做一个网站”,它可能需要理解需求、搜索资料、写代码、调工具、跑测试、找Bug、修改、再测试……一个任务可能消耗几十万、几百万甚至更多Token。
再往后是Multi-Agent:一个Agent负责规划,一个负责搜索,一个写代码,一个测试,一个审查。Token需求继续膨胀。
2026年第一季度,全球每周Token使用量暴增250%至22.7万亿。OpenAI平台Token调用量从2025年10月的每分钟约60亿次,飙升至2026年3月底的150亿次,不足半年暴增150%。摩根士丹利报告显示,顶尖大语言模型正经历“非线性的能力跃升”,AI爆炸式增长正碰上系统性的供应瓶颈。
所以真正发生的事情不是Token变贵了,而是每个人开始需要越来越多Token。这可能比单纯涨价更可怕。
经济学里有一个经典现象叫“杰文斯悖论”:
当一种资源的使用效率提高、单位成本下降之后,人们未必会减少使用,反而可能因为它变便宜了而大量增加使用。
AI正在出现类似的情况。
Token越便宜,大家越敢让AI干更多事情;AI越聪明,大家又越愿意把更复杂的事情交给它。
于是,Token消耗形成了一个新的增长飞轮。
智谱上天猫卖Token,看起来是在卖AI额度。但从半年报看,它真正做的是把模型能力变成可以持续计费的云服务。
2025年,智谱主要收入还是本地化部署;到了2026年上半年,MaaS/API已经占收入86.5%。公司将这一演进路径概括为:“卖模型→卖调用→卖订阅→卖端到端任务结果”。
智谱董事会秘书肖磊在财报电话会上直言:“相较收入增速,收入构成的切换更值得关注。”
这种切换意味着商业模式的根本变化——从一次性项目交付,变成持续性的服务收入。而定价逻辑也会随之改变:从“每百万Token多少钱”变成“完成一个任务多少钱”。智谱董事长刘德兵在电话会上表示:“单点榜单领先很快会被追平,真正重要的是谁能持续用更低成本交付更高智能。”
未来的趋势可能是这样的:
基础Token会越来越便宜,但高级智能会越来越贵。
就像云计算:服务器越来越便宜,但企业买云服务的钱并没有因此消失,因为大家用得更多了。
AI也一样。单Token价格下降≠AI使用成本下降。因为模型越强,大家让它做的事情越复杂。从问一个问题到完成一个任务,再到管理一整套工作流,Token消耗会不断扩大。
智谱半年报中有一句话值得反复咀嚼:“模型每完成一次能力跃迁,客户购买的东西就向结果靠近一步,本公司的收入结构随之改写一次。”
所以未来真正值得关注的可能不是“1元能买多少Token”,而是一个人、一家公司,每个月到底消耗多少AI智能。
而智谱把Token摆上天猫,可能只是这场“AI计量经济”走向大众的第一步。
本文来源:创业邦
