Token 越便宜,世界越饥渴
2021 年 11 月,GPT-3 的 API 对外开放。价格:每百万 token 60 美元。
2024 年 7 月,GPT-4o-mini 发布。同一类任务的价格:每百万 token 0.15 美元。
三年不到,降了 400 倍。
如果 token 只是”写文章的工具”,400 倍的降价应该只带来一些增量——人们多用几次 ChatGPT,多润色几篇邮件,仅此而已。需求有上限,因为人一天只有 24 小时,不会因为 AI 写作变便宜就读十倍的文章。
但实际发生的是什么?
中国的日均 token 消费量,从 2024 年初的 1000 亿,涨到了 2026 年 2 月的 180 万亿。十八个月,涨了 1800 倍。
OpenAI 的企业客户,单个组织的推理 token 消费量年同比增长 320 倍。
Google 旗下各产品处理的 token 总量,从 2025 年 5 月的每月 480 万亿涨到了 10 月的 1300 万亿——五个月翻了 2.7 倍。
价格降了 400 倍,消费涨了 1800 倍。
这不是 Jevons 悖论”可能成立”。这是 Jevons 悖论在现实中以极端形式上演。需求弹性不是略高于 1——而是远远超过 1。Token 降价释放出来的需求,比降价本身猛烈得多。
问题是:这些多出来的 token 去哪了?谁在”消费”它们?为什么需求弹性可以如此惊人?
答案藏在 token 消费的分层结构里。
从 FLOPS 到 Token:计算资源的价格-需求曲线长什么样
a16z 给这个趋势起了个名字:LLMflation。对于同等性能的 LLM,推理成本每年降 10 倍。这个速度比 PC 时代的算力降价(Moore’s Law)还快,比互联网时代的带宽降价(Edholm’s Law)也快。
这不是第一次发生。
CPU 算力在过去 60 年里降了大约 10 的 10 次方倍。同一时期,全球总计算消费量涨了大约 10 的 15 次方倍。降了十万亿倍,用了一千万亿倍。需求增长比降价快了十万倍。
带宽同样。存储同样。每一种基础计算资源都遵循同一个模式:当成本下降到一个新的数量级,不是”同样多的人用更多”,而是”一大批以前完全不在市场里的使用场景突然涌入”。
从大型机到 PC,不是”同样的科学家多算了几个方程”——而是几十亿普通人开始用计算机做文字处理、打游戏、看视频。从拨号上网到光纤,不是”同样的人多看了几个网页”——而是 Netflix、YouTube、TikTok 这些以前不可能存在的应用整个品类冒出来。
Token 正在重演这个历史。但它有一个关键的不同——token 不是一种”基础设施资源”(像电、带宽、存储),而是一种“认知服务”的定价单位。你买的不是”计算能力”,你买的是”一段思考”。
这让 token 的需求弹性分层变得更复杂,也更有趣。
三种 Token 消费,三种弹性
不是所有 token 消费都一样。把”token 使用量涨了 1800 倍”当成一个整体数字来看,会错过最重要的结构性信息。
第一层:人机对话型(弹性中等)
这是大多数人直觉中的 token 消费方式——你打开 ChatGPT 问一个问题,它回答你。你用 Copilot 写一段代码,它给你建议。你让 Claude 润色一封邮件。
这一层的消费受人类注意力和时间的硬约束。你一天只能和 AI 对话这么多次。你一天只能阅读和判断这么多 AI 生成的内容。即使 token 免费了,你也不会一天问 AI 一万个问题——因为你没有时间消化一万个答案。
所以这一层的弹性是中等的。Token 价格降 10 倍,个人使用量可能涨 3-5 倍(从”每天问 10 个问题”涨到”每天问 30-50 个问题”)。但不会涨 100 倍。这层更像”翻译”——你不会因为翻译变便宜就把同一篇文章翻译十遍。
第二层:Agent/自动化型(弹性接近无限)
这是 token 消费增长最快的部分,也是 1800 倍增长的最大贡献者。
一个 AI Agent 不受人类时间约束。它可以 24 小时不停地运行。它可以并行启动一百个分支。它可以反复尝试、自我纠错、循环迭代,直到达到目标。每一次循环都消耗 token。
具体来看程序员的视角。
传统使用方式:程序员问 AI “怎么写一个排序算法?”,AI 回答 500 token。一天问 50 个问题 = 25,000 token。
Agentic 使用方式:程序员给 Claude Code 一个任务”重构这个认证模块”。Agent 开始自主工作——读代码、分析依赖、制定计划、写代码、跑测试、发现 bug、修复、再跑测试……一个任务下来可能消耗几十万甚至上百万 token。开发者报告显示,使用 Claude Code 做 agentic coding 的月花费在 $500-2000 之间(纯 API 成本)。Agent 团队模式消耗约 7 倍于普通会话的 token。
Andrew Ng 算了一笔账:如果一个 AI agent 持续以 100 tokens/sec 运行,按 $4/M tokens 计算,成本是 $1.44/小时——比美国最低工资还低。
这意味着什么?意味着当 token 足够便宜,程序员的工作方式会发生根本转变——从”想好再写”到”让 AI 跑所有可能的方案,从中挑最好的”。从”节约 token”到”挥霍 token”。
以前你调试一个 bug 是:先想可能的原因,试两三种修法,如果不行再查文档。现在你可以让 agent 同时跑 20 种修法、自动测试每一种、告诉你哪种通过了。Token 成本几美分。人力节省几小时。
这一层的弹性为什么接近无限?因为它的约束不是人类时间——而是“解决这个问题的经济价值 > 消耗的 token 成本”。只要一个问题的解决价值大于几美分的 token 成本,agent 就”值得跑”。而在现实世界中,有几乎无穷多的问题的价值大于几美分。
阿里巴巴 CEO 在 2025 云栖大会上说:”Token 消费速度每两到三个月翻一倍。” 这个速度主要由 agent 层驱动。
第三层:嵌入式/平台型(弹性取决于终端用户规模)
这是 Google 每月 1.3 千万亿 token 的主要来源。不是人在和 AI 对话——而是 AI 被嵌入到搜索、邮件、文档、地图等产品的每一次请求中。用户可能根本不知道自己在”消费 token”,他们只是在用 Google 搜索,但每次搜索背后 Gemini 都在跑。
这一层的弹性取决于终端产品的用户增长。当 token 便宜到可以嵌入每一个产品的每一次交互时,token 消费量基本等于”全球所有数字产品的总请求量 × 每次请求的 token 数”。这个数字几乎没有上限。
还有一个新兴的子层:视频和多模态。字节跳动的 Seedance 2.0 生成一段 10 秒 1080p 视频需要约 35 万 token。一个完整的动画项目可能需要数亿 token。当视频生成的 token 成本降到可承受水平时,这个子层的需求爆发会是目前文本层的数十倍甚至数百倍。
从一行代码到十亿人:Token 弹性的三个尺度
把三层弹性放在一起看,才能理解”Token 越便宜,世界越饥渴”到底意味着什么。
程序员尺度:从工具到环境
Token 对程序员来说正在从一种”工具”变成一种”环境”。
工具阶段(2023-2024):你向 AI 提问,AI 回答你。你是主导者,AI 是助手。Token 消费受限于你提问的频率。
环境阶段(2025-):你设定目标,AI 自主探索。你的 token 消费不再受限于你”问了多少问题”,而是受限于”你给 agent 设定了多大的搜索空间”。
一个具体的例子。以前:你花 30 分钟写一个函数,花 10 分钟 debug。总 token 消费:几千(问了几个问题)。现在:你花 2 分钟描述你想要什么,agent 花 10 分钟自主尝试 50 种实现方式、跑 200 次测试、选出最优解。总 token 消费:几十万。但你省了 38 分钟。
当 token 成本低于你时间成本的时候,理性选择是”让 agent 多跑”。这就是为什么程序员视角下的 token 弹性极高——因为程序员的时间很贵($50-200/hr),而 token 很便宜($1.44/hr 持续运行)。每降一次价,”值得让 agent 跑”的问题就多一批。
公司尺度:从点到面
OpenAI 的 Enterprise AI 报告显示:企业 API 调用量年同比增长 8 倍,推理 token per organization 增长 320 倍。
320 倍不是”同样的事情做多了”。这是”以前没在用 AI 的流程开始用了”。
公司的 AI 采用路径通常是: 1. 一个团队试点(产品团队用 AI 写文档) → token 消耗:低 2. 核心流程上线(客服用 AI 做初步回复) → token 消耗:中 3. 全面扩散(财务、法务、HR、运营全部接入 AI) → token 消耗:高 4. Agent 化(AI 不再只辅助人,开始自主执行任务) → token 消耗:爆发
大部分公司在 2024 年处于 1-2 阶段。2025 年开始进入 3 阶段。320 倍的增长反映的是从”点”到”面”的扩散。
当 token 再降 10 倍,阶段 4 变得经济可行。这时候 token 消费不是”按人头”算的——而是”按任务数”算的。一个公司可能有 1000 个员工,但有 10 万个可以被 agent 自动处理的日常任务。每个任务消耗 10 万 token = 每天 100 亿 token = 成本可能只有几百美元。
这就是为什么企业层面 token 弹性可以到 320 倍——因为企业内部”值得自动化但以前成本太高”的任务数量远多于员工数量。
社会尺度:从有到无
最大的弹性藏在第三个尺度。
全球 12 亿人从未享受过个性化教育服务。不是不想——是以前要一个真人家教,每小时 $30-100,一般家庭负担不起。AI tutor 的边际成本是每小时几美分的 token。当 token 足够便宜,这 12 亿人全部成为”新进入的消费者”。
类似的逻辑适用于: - 基础法律咨询(全球数十亿人从未咨询过律师) - 心理健康支持(stigma + 费用双重壁垒,AI 同时解决两者) - 多语言信息获取(大量优质内容只有英语版,AI 翻译让小语种用户进场) - 中小企业的数据分析(以前需要雇分析师,现在几百块/月)
这些场景的弹性不是”已有用户用更多”——而是“几十亿从来不在这个市场里的人突然进场”。这是 Jevons 悖论最纯粹的形式:成本下降解锁了一个以前完全不存在的巨大市场。
世界银行的数据印证了这一点:新兴市场的 EdTech 企业 86% 已集成 AI,AgTech 70%,Fintech 54%。这不是硅谷的玩具——这是正在覆盖几十亿人的基础服务。
数据说了什么
把所有数字放在一起:
| 指标 | 时间 | 数值 | 增速 |
|---|---|---|---|
| 中国日均 token | 2024.01→2026.02 | 100B→180T | 1800x / 18个月 |
| 火山引擎日均 | 2024底→2026.01 | 2T→63T | 31.5x / 13个月 |
| Google 月处理量 | 2025.05→2025.10 | 480T→1300T | 2.7x / 5个月 |
| Microsoft Azure 季度 | 2024 Q3→2025 Q3 | ~20T→100T | 5x YoY |
| OpenAI API 日均 | 2025.10 | 8.6T | — |
| OpenAI 企业推理/org | YoY | — | 320x |
| Token 价格(等效性能) | YoY | — | -10x |
价格每年降 10 倍。消费每年涨 100-1000 倍。
这意味着全球 token 市场的总支出(价格 × 数量)仍然在快速增长——即使单价在暴跌。a16z 指出了一个有趣的现象:OpenAI 的顶级模型 o1 的输出 token 价格仍然是 $60/M——和三年前 GPT-3 的价格一样。说明市场的顶端在用”更贵的 token”换取更高质量的推理,底端在用”更便宜的 token”覆盖更多场景。
这正是一个需求极高弹性市场的特征:低端放量、高端保价。和智能手机市场类似——iPhone 卖 $1000,但全球智能手机出货量 12 亿台/年,因为低价安卓覆盖了所有人。
Token 弹性告诉你该押注什么
回到经济学。
Jevons 悖论的第三个条件是”需求弹性必须足够高”。Token 市场的实际数据告诉我们:这个弹性不是略高于 1,而是高到令人震惊的程度。价格降 10 倍,消费涨 100-1000 倍。
但弹性不是均匀分布的。
- 人机对话层(你用 ChatGPT 问问题):弹性中等。受注意力约束。这一层接近”翻译”类需求——便宜了不会多用十倍。
- Agent/自动化层(AI 自主循环执行任务):弹性极高。唯一约束是”任务价值 > token 成本”。这一层接近”计算资源”——每降一个数量级就解锁一批新场景。
- 全球化服务层(以前买不起的人进场):弹性极高。从 0 到 1 的跃迁。这一层最接近”棉布”——十几亿被压抑的需求等待释放。
对个人的含义很明确:
如果你把 token 当”写文章的工具”,你在消费弹性最低的那一层。 你的价值被注意力天花板限制——你一天只能写/看这么多文章。
如果你把 token 当”agent 的燃料”,你在消费弹性最高的层。 你的价值不受你个人时间约束,而是受你能定义多少”值得解决的问题”约束。
如果你把 token 当”全球化服务的基础设施”,你在消费弹性最大的市场里。 你面对的不是”已有用户用更多”,而是”几十亿新用户从零开始”。
最大的错误是:把 token 仅仅理解为”更便宜的写作/翻译/编程工具”——这是低弹性视角。Token 的本质是通用认知基础设施的计量单位。它的需求弹性曲线更像电、带宽、算力——每一次数量级的降价都会催生出一整个新的应用层,而新应用层消耗的总量会远超上一代。
我们今天看到的 1800 倍增长,大概率还只是开始。
附:本文引用的资料来源
- LLMflation 趋势(a16z, Guido Appenzeller):https://a16z.com/llmflation-llm-inference-cost/
- 全球 Token 消费追踪数据:https://robonomics.substack.com/p/token-tracker-and-implications
- OpenAI State of Enterprise AI 2025:https://cdn.openai.com/pdf/7ef17d82-96bf-4dd1-9df2-228f7f377a29/the-state-of-enterprise-ai_2025-report.pdf
- LLM 推理成本对比分析(Introl):https://introl.com/blog/inference-unit-economics-true-cost-per-million-tokens-guide
- Token 降价对 AI 公司的含义(Andrew Ng / DeepLearning.AI):https://www.deeplearning.ai/the-batch/falling-llm-token-prices-and-what-they-mean-for-ai-companies/
- Agentic Coding 成本分析(Vantage):https://www.vantage.sh/blog/agentic-coding-costs
- Claude Code Token 管理文档:https://code.claude.com/docs/en/costs
- AI 在新兴市场扩散(World Bank):https://blogs.worldbank.org/en/psd/how-ai-travels–diffusion-among-firms-in-emerging-markets
- Google Token 处理量(Official Blog):https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/gemini-enterprise-sundar-pichai/
- ChatGPT 用户数据(TechCrunch):https://techcrunch.com/2025/07/21/chatgpt-users-send-2-5-billion-prompts-a-day/
Comments
Select any text to comment on a specific part. Existing inline comments appear as small numbered bubbles. Powered by GitHub Discussions.