AI 领域的所有人都在关注同一个数字的下跌。Token 的价格——即 AI 模型读写的基本单位——在三年内下降了约三个数量级。人们的直觉反应是将其视为毫无疑问的好消息:智能正在变得免费,因此任何基于此进行开发的人都能获益。
但这种直觉是错误的,真正重要的数字是那个正在上升的数字。在每 Token 价格崩塌的同时,企业在 AI 上的支出在一年内增长了 320%。这两个事实可以同时成立,而理清它们之间的关系正是核心所在。你不能仅凭 Token 的价格来评估 AI 经济的价值——或者决定在其中投入资本的位置——因为价格只是模型中的一个维度。这是一个披着通缩外衣的需求故事。
我们与创始人并肩作战,并作为资本伙伴共同投资 AI 公司,因此这对我们而言并非学术问题。这是我们在签署支票前必须回答的问题:当智能的单位成本下降如此之快时,价值究竟流向了哪里?以下是我们使用的模型,以及它得出的结论。
为何 Token 是合适的计量单位
先从单位本身说起,正是它让 AI 首次具备了作为经济体的可计量性。Token 是文本片段——粗略估算约为四分之三个单词——每一次与大语言模型的交互都按读取的 Token(输入)和写入的 Token(输出)进行计量。一个句子涉及数十个 Token;一份文档数千个;而自主“Agent”执行任务时可能消耗数百万个。
这意味着机器智能首次拥有了带有公开价格的原子级消费单位——如同电力有千瓦时、数据有 GB。一旦某物可被计量,即可建立模型:总支出等于每 Token 价格乘以消耗量。绝大多数公开评论都痴迷于前者,而真正的利润在于后者。
供应侧:智能正在变得更便宜——但并非到处如此
这种通缩是真实的,且在历史上是极速的。在能力水平保持不变的情况下,推理成本在连续三年中每年下降约 10 倍——a1<0xA6>z 将其称为“LLMflation”。根据特定的能力基准衡量,Epoch AI 指出,根据任务的不同,下降幅度每年在 9 倍到 900 倍之间,中位数约为 50 倍,且最难问题的最前沿领域通缩最快。其驱动因素是多重且持久的:更先进的芯片、更高效的算法、激烈的竞争,以及一波重塑价格底线的开源权重模型浪潮。
然而,“便宜了 1,000 倍”这一笼统说法掩盖了对投资者至关重要的细微差别,Exhibit 1 将其揭示出来:前沿领域几乎未受通缩影响;崩塌的仅是商品化层级。
这一点至关重要,因为真正产生回报的工作负载——即下文我们将讨论的推理和 Agent 任务——运行在前沿领域,而该领域并未变得更便宜。近乎免费的 Token 是去年的能力水平。任何假设依靠商品化定价来实现高利润率的商业计划,都在暗中赌注其最难、最有价值的工作可以在廉价层级上运行。事实通常并非如此。
需求侧:消耗量正在爆炸
现在谈谈每个人都低估的维度。随着价格下降,Token 的消耗量正在以快得多的速度增长——而且这是出于结构性原因,而非周期性原因。两种力量在共同作用。
第一种是任务成本的变化。单轮对话的回答仅需几百个 Token。但行业已果断转向在回答前会进行“思考”的模型,以及能够自主循环执行任务的 Agent。到 2025 年,推理 Token 已占所有输出 Token 的 50% 以上;Agent 工作负载消耗的 Token 是简单对话的 10 到 100 倍。单次深度研究式运行可能会消耗 30 万个 Token。Exhibit 2 展示了这种倍数关系。
第二种力量是价格弹性,它是整个模型的关键。Token 需求不仅具有弹性,更是超弹性的。模拟显示其弹性系数大于 1 —— 约 1% 的价格下降驱动 1.4% 的需求增长 —— 这意味着随着单价下跌,总美元支出反而上升。 现实证据确凿:推理成本降低约 1,000 倍,而需求估计激增 10,000 倍;2025 年企业级 AI 支出在每 Token 价格下降的同时跃升 320%。这正是杰文斯悖论(Jevons' paradox)——资源使用成本降低反而导致总消耗量增加。更便宜的 Token 不会缩减账单,而是扩大市场。
两种 Token 经济体
消耗量分布不均,地理格局本身即是一种资源配置决策。目前两大截然不同的 Token 经济体已现雏形,它们从需求曲线的两端向上攀升。
| 美国 — 前沿领域 | 中国 — 商品化 / 开源权重 | |
|---|---|---|
| 模型定位 | 封闭的前沿实验室;按 Token API + 订阅制 | 开源权重,蓄意的“向零竞争” |
| 代表性价格 ($/M input) | ~$5.00 (前沿旗舰) | ~$0.14 — 差距约 35× |
| 消耗规模 | OpenAI ~15B tokens/min (~650T/mo); MS Foundry FY2025 >500T | 全国 >140T tokens/day; 字节跳动豆包单应用 >120T/day |
| 增长驱动力 | 能力与 Agent 的深度 | 价格 → 规模,嵌入超级 App 的使用 |
| 变现方式 | Token 利润 + 订阅制 | 云/基础设施 + 生态锁定,而非 Token 利润 |
美国销售的是量少、价高、值高的 Token:封闭的前沿实验室直接通过能力变现。中国制造了海量、近乎免费的商品化 Token,将开源权重作为战略工具,通过云、基础设施和超级 App 的生态锁定变现,而非依赖 Token 本身。表中被严重低估的事实在于其脚注:在中立平台上,中国开源权重模型在消耗量上已超越美国模型,且目前正为对成本敏感的美国企业提供近一半的使用需求。前沿领域的利润率尚未受到 35× 廉价替代品的全面冲击,但终将面临。
模型:一个价格下降、美元规模增长的市场
将这些维度整合起来。每 Token 价格正在崩塌(Exhibit 1)。单任务 Token 数和总 Token 数正在爆炸式增长(Exhibit 2),且需求具有足够的弹性,使得低价反而提升了总收入。两者的乘积——即以美元计的 Token 经济体的实际规模——因此正在增长,且增长曲线尚处于早期阶段。Exhibit 4 是规模验证。
| 指标 | 水平 (2026) | 增长 |
|---|---|---|
| Google — 月处理 Token 数 | 3.2 quadrillion | 自 2024 年 4 月以来约 330× (全平台) |
| OpenAI — API tokens / 分钟 | 15 billion | 六个月内约 2.5× |
| 中国 — 日处理 Token 总量 | >140 trillion | 自 2024 年初以来 >1,000× |
| 企业级 AI 支出 | +320% (2025) | 在单价下降的同时增长 |
| Goldman 预测 — 2030 年每月 Token 数 | ~120 quadrillion | 较 2026 年约 24× |
因此,首要结论对市场看涨,对单位利润率看跌:Token 经济体以美元计呈复利增长,尽管单个 Token 正趋近于免费。然而,投资者关注的并非总市场规模,而是价值留存之处。
资金汇聚之处
通缩不会均匀分配收益。它将利润输送给拥有稀缺资源者,却让持有可替代品者陷入困境。请沿技术栈向下审视毛利率分布。
芯片层级截留了每美元中约四分之三的利润,因为算力是真正稀缺的投入品,且整个 24× 的需求曲线均流经此处。模型实验室正在改善利润率——值得注意的是,部分改善源于与自身客户的竞争,即将应用层功能内化至模型本身。应用层则承受镜像效应:Token 支出成为永久性的销货成本(COGS)变量,将毛利率从传统软件的 80–90% 拉低至 50–60%。“推理是新的 COGS”并非口号,而是对每一家转售他人智能的 AI 业务的结构性利润削减。
这也是为什么定价模式正在所有人脚下发生形变。按席位(Per-seat)计费的软件定价——即按用户收费,并以近乎零的边际成本提供服务——在每个活跃用户都背负着真实且不断增长的 Token 账单时会失效。市场正转向基于消耗和结果的定价,正是因为成本基数现在随使用量同步扩张。对于投资者而言,一个按席位计费的 AI 业务正承担着未被定价的利润风险。
投资者结论
模型只有在能告诉你该怎么做时才有用。我们的模型可以,我们将直言不讳地阐述。核心原则是:持久的利润率属于那些拥有稀缺投入品的人——无论是前沿算力、专有数据还是最终结果——而不是属于编写提示词(Prompt)的人。
值得投资 —— 拥有稀缺投入品的地方:
- 前沿算力,及其定价权的挑战者。 该层级未发生通缩,且所有需求均流经此处。这既包括现任巨头,也包括威胁现有 ~73% 利润率的定制芯片厂商。
- 推理基础设施 —— 需求爆炸的“铲子与铁锹”。 无论哪个模型胜出,服务、路由、缓存和优化都能从弹性增长的销量中获利。
- 拥有专有数据和工作流护城河的应用。 如果应用的防御力在于前沿 API 无法复制的数据或嵌入式工作流,那么随着 Token 成本下降,它们仍能保持定价权。
- 基于结果和消耗量定价的业务。 其收入随 Token 账单同步增长,而非被其压垮的模型。
应当避开 —— 租用他人投入品的地方:
- 缺乏数据或工作流护城河的薄弱“套壳”应用 —— 此类应用正被实验室通过功能内化而逐渐边缘化。 - 预期利润率为传统 SaaS 水平的 AI 应用。 真实的结构性数字是 50–60%;任何假设为 85% 的计划都是定价错误的。 (Remove this line) - AI 产品的按席位计费模式 —— 这是一种正在走向消亡、且带有未定价重定价风险的模型。 - 没有成本或分发优势的商品化模型转售商;中国的价格战将是它们的灭绝事件。
此外,赛马式评论完全忽略了一个观点:请将美国前沿经济体与中国商品化经济体视为不同的资产类别,二者基于不同逻辑运行——前沿领域押注能力驱动的价值增长,开源权重层级则博弈规模与成本底线——切勿假设前沿利润率能在面对低 35× 的替代品时幸存。
结语
对于我们所在的金融服务领域,该模型解决了一个占用过多讨论时间的争论。对于部署 AI 的银行来说,Token 账单相对于其涉及的价值而言只是微不足道的误差——生成式 AI 对全球银行业而言,每年价值可达 2,000 亿至 3,400 亿美元。真正的约束不在于智能的价格,而在于大多数机构仍停留在试点阶段,只有一小部分采用案例真正进入了生产环境。被错失的价值在于部署与治理,而非节省几分钱的 Token 成本。
这是我们应用该模型系列文章的第一篇——我们将探讨金融服务领域的采用情况、Agent 激增带来的价值流向,以及在中美分化两端建立的业务。贯穿始终的原则值得铭记:当某样东西变得极度廉价时,其价值并不会消失,而是会发生迁移。开发者兼投资者的任务,就是占领价值落脚的地方。
