内部参考 · 勿外传 · 2026-09-03

中金《Token 启示录》一至六 · 精读

六篇 156 页,压成一页可用的:每个数字带页码,每个结论后面跟用法;与我方既有锚点逐条印证或冲突。原文存于 算力/中金报告/。

精读日期:2026-09-03   覆盖:六篇(2026-05-10 ~ 08-26,共 156 页)   引用规则:页码均可回溯原 PDF(算力/中金报告/)
内部客户开发资料 · 请勿外传

00 · ONE PAGE一页总览

六篇的骨架一句话:(一)token 还要涨 5 倍 →(二)理论上卖 token 毛利 60% →(三)现实是国内头部亏 −318%~−439% →(四)差距由四层技术决定 →(五)公式与瀑布:成本可压 99.9% →(六)开源把量做大、把价托住。合读的结论:token 是门好生意,但只对能把「理论 60%」兑现出来的人——中金把兑现路径逐项标了价。

六篇各一句话

(一)05-10Agent 单任务是对话的数十倍 token,全国日均 140 万亿只是起点,还有 5 倍以上空间(p.3, 7-8)
(二)05-10NVL72 口径:自建 1.95 / 租赁 2.60 美元/百万 token;全卖 token 理论经营利润率 60%+,只出租仅 20%(p.2, 6-7)
(三)06-182025 实景:API 毛利率 OpenAI 33% / Anthropic 40% / 智谱 19% / MiniMax 55%,亏损率 −108% ~ −439%;模型厂约 Year5 转正(p.22, 26)
(四)08-23推理优化=模型架构/算法/引擎/异构调度四层 Co-design,单项不构成壁垒;PD 分离实证最高 +498% 有效承载(p.4-5, 25-28)
(五)08-24成本公式四因子,瀑布 44.46→0.039 美元(−99.9%);其中引擎 η、缓存、利用率 U 三步(部署侧可做)合计 −96.8%(p.11-12)
(六)08-262027 开源占全球 token 量 50–70% 但价值量仅 12–30%;开源不等于低价(DeepSeek 输出价 +125%);推理调优平台 Fireworks/Together/Baseten ARR 各约 10 亿美元、估值百亿级(p.1, 8, 13, 17)

可直接进谈判话术的三个中金数字

① η=10%:通用框架只兑现一成

「中金测算:用通用开源框架部署,引擎工程达成率默认只有 10%,成熟引擎能到 61%——你的集群哪怕排满,理论吞吐可能九成没兑现。」((五)p.18)比「利用率 30%」更锋利,因为它把责任从「没客户」切到「没工程」。

② 最后三步 −96.8%,归部署侧

「模型架构的红利归模型厂;但引擎、缓存、利用率三步——从 0.891 到 0.039 美元——是部署方自己做不了、模型厂不会替你做的。」((五)p.12 图 10)

③ 海外同行值一百亿美元

「做这件事的 Fireworks / Together / Baseten,ARR 各约 10 亿美元、估值 83–175 亿美元;Together 引擎较 vLLM 数倍吞吐。」((六)p.8, 17)给园区、给投资人的估值对标,出自中金而非我们自己。

同时必须记住:中金对第三方优化的三盆冷水(详见第 05 章)

①vLLM/SGLang 已把多数通用优化沉淀为公共基线;②头部模型厂自研闭源引擎,「原厂调优」最懂自家模型;③测算篇观点直言:第三方是阶段性抢身位,「长期需要向硬件或向模型靠拢」((四)p.5, 22-23;(五)p.1)。这三条不反驳,要接住——我们的答案正是「向硬件靠拢」那一支。

01 · DEMAND需求侧:Agentic 的 Token 曲线(第一篇,2026-05-10)

中金的核心判断:日均 Token 消耗还有 5 倍以上增长空间,驱动力从 Chatbot 换成 Agent——单任务计算载荷是对话的数十倍。对我们:这条曲线是所有客户「产能焦虑」的来源,开场引用它,比讲技术更快对齐。

1.1 曲线本身(全部带页码)

140 万亿/日
2026-03 全国日均 Token 调用,较 2024 年初(约 0.1 万亿)增超 1,400 倍,较 2025 底(100 万亿)再 +40%(p.3 图 2)
×50
重度 Agent 用户人均日消耗 456 万 tokens,是 Chatbot 人均(9 万)的 51 倍;渗透率仅需 2% 即再造一个全体 Chatbot 的量(p.6 图 7)
5 倍+
中金按「替代人类时长」法测算的日均 Token 增长空间(每小时 500–720 万 tokens × 1–2h × 渗透 8–15%,p.7-8 图 10)
×320
企业 API 推理 Token 同比增速(引 OpenAI 企业报告,p.9)——企业侧比个人侧陡得多

厂商样本:豆包日均 120 万亿(3 个月翻倍,两年 ×1,000);MiniMax 单日消耗 2 个月 ×6,coding plan ×10;智谱 coding plan 半年 ×15(p.3)。海外收入侧:Anthropic ARR 四个月 90→300 亿美元(+230%),OpenAI 250 亿美元(p.3)。中国模型全球周调用 4.12 万亿 首超美国 2.94 万亿(2026-02,p.8)。

1.2 为什么 Agent 吃 token:三个机制(p.4-6)

1.3 用法

这一篇给我们的三句话

① 对机房方:「中金测的是还有 5 倍——你担心的不该是没需求,是需求来了接不住、接住了不挣钱。」
② 对园区/工研院:「企业侧 token 同比 ×320,孵化项目的 token 账单只会更陡——一亿元预算按今天的单价规划,明年就不够。」
③ 对 Token 中标商:「Agent 情景下输入:输出=8:1、缓存占比 50%(p.4 图 3)——你的成本结构会向 Prefill 与缓存倾斜,这正是 PD 分离与缓存工程的主场。

口径注意:中金第一篇的受益名单(智谱、MiniMax、金山云、万国数据、世纪互联、网宿、深信服,p.10)里没有任何第三方优化服务商——这个「缺席」在第 05 章展开。

02 · ECONOMICS单位经济:谁在挣钱(第二/三/六篇)

三篇合起来回答一个问题:token 这门生意的钱在哪一层。中金的答案:理论上 Token Factory 毛利率可到 60%,现实里国内头部亏损率还在 −318% 到 −439%——理论与现实之间那道沟,就是推理效率,也就是我们。

2.1 中金的成本账(第二篇,NVL72 口径)

口径每百万 Token 成本构成与假设
自建(Capex)1.95 美元折旧 1.11 + 电费 0.13 + 其他 0.72;单机柜 Capex 650 万美元、年输出 0.91 万亿 tokens(第二篇 p.2 图 1)
租赁(Opex)2.60 美元GB200 10 美元/卡时 × 75% 折扣,单机柜年租 240 万美元(p.2-3 图 2)
卖 Token售价 4–5 美元全部产 Token → API 经营利润率可超 60%
全部出租只有 20%
租算力产 Token 溢价约 40%(p.6-7 图 6)

关键假设(第 04 章有全录,先记三个):折旧 5 年(计算设备)、有效 Tokens 利用率 40%、GB200 吞吐 1,000 tokens/s(弹性极大,p.2-3)。40% 这个假设高于行业实测的 ~30%——中金自己也称这是「理论毛利率」;理论 60% 与现实亏损的差,就差在这类假设兑现不了。

2.2 现实:2025 年成本结构盘点(第三篇 p.22 图 29,全场最硬一张表)

厂商API 毛利率推理成本/收入训练成本/收入亏损率
OpenAI33%67%99%108%
Anthropic40%60%91%116%
智谱19%81%378%439%
MiniMax55%45%249%318%

与我方招股书口径对照:方向完全一致(MiniMax 显著优于智谱),幅度不同——我方口径智谱云端 −0.4% vs MiniMax 69.4%,中金口径 19% vs 55%(年份与分部口径差异)。两套口径都指向同一句话:同样的卡、同样的模型档位,推理效率决定谁的毛利率是谁的三倍。中金补充的机制解释(第三篇 p.24):MiniMax M3 自研 MSA 使百万上下文单 token 计算量降至上代 1/20;DeepSeek V4 单 token FLOPs 仅 27%、KV Cache 仅 10%。盈利时间表:中金假设模型 Year5 营业利润率转正、Year8 达 42%;Anthropic/OpenAI 分别 2029/2030 年盈利(p.25-26)。

2.3 开源的「地板」在抬升(第六篇)

(六)p.17 这段话应该裱起来——中金替我们写了业务说明书

中金定义推理调优平台的核心:「不是卖 GPU 算力,而是 FP8/FP4 量化、蒸馏、FlashAttention/Kernel Fusion、Continuous Batching、PagedAttention、KV Cache、投机采样等全栈技术,以同等 GPU/Memory 资源提供更多 Token 产出,降低终端客户单位推理成本」——并给出实绩:Fireworks 量化提升 30%50%,Together 引擎较 vLLM 数倍吞吐这三家就是我们的海外估值对标:百亿美元级。对投资人、对工研院,这一页比我们自己说一百句都管用。

同页的冷水也要喝:第三方 API 挂牌价比官方贵约 4 倍(DeepSeek 官方 0.44/0.87 vs 三家 1.74/3.48 美元,p.17 图 19)——第三方从来不是靠价格赢,是靠吞吐、SLA 与私有化;以及价值分配里硬件 40%/云 25%/模型 30%/聚合仅 5%(p.15)。中金整体叙事是「走向盈利」,比我们「出清定生死」的口径温和——引用时注意语气差。

03 · TECH MAP技术篇 × 我方七项优势(第四篇,2026-08-23)

技术篇的框架是四层:模型架构 → 优化算法 → 推理引擎 → 异构调度(p.4 图 1)。结论一句话:「未来领先厂商的核心竞争力来自模型、推理框架与硬件之间的持续 Co-design」——单项优化不构成壁垒。下表把中金的技术项、收益数字与我方七项优势逐项对上:凡是有中金页码的,谈判里就不用我们自证了。

3.1 对照表(中金数字全部带页码)

我方优势 ↔ 中金技术项中金给的量化收益与出处
大 EP / MoE ↔ MoE 与专家并行MoE 使 Prefill 成本 −84.7%(稠密 400B $0.85 → MoE 671B/37B $0.13,(五)p.14 图 12);EP 的瓶颈=热门专家拖慢整轮,优化点是拓扑感知路由/层次化 All-to-All/通信计算重叠/在线负载均衡((四)p.29-31)——正是我们做的脏活
PD 分离 ↔ Prefill/Decode 分置引擎乘数 1.20–1.50×((五)p.18 图 16);Mooncake 实证:Kimi 集群请求承载 +107%~115%,SLO 约束下有效承载最高 +498%;K2 在 128×H200 上 PD 分离+大 EP:Prefill 22.4 万 / Decode 28.8 万 tok/s((四)p.25-28)
Megakernel / 算子优化 ↔ 专用 Kernel 与算子融合中金无「megakernel」一词,表述为:专用 Kernel、算子融合、避免高精度回退与冗余访存;「新模型发布首日完成算子补齐」是引擎竞争重点((四)p.10、p.22);FP4 Kernel 覆盖度单独作 1.15–1.50× 乘数((五)p.18)
量化 ↔ FP8/FP4/INT 系B300 实测 FP4 吞吐 ≈ FP8 的 2 倍、BF16 的 3.5–4 倍((四)p.14-16);成本表:权重 FP4+KV FP8 较 FP8/FP16 −60.8%((五)p.16 图 14)
长上下文 ↔ 稀疏/混合注意力 + KV 压缩 + 前缀缓存3:1 混合注意力:128K 上下文降本 −51%、512K −62.5%((五)p.15 图 13);MLA 的 KV 是 MHA 的 1/25、成本 −96%((五)p.13 图 11);Agent 任务前缀缓存命中 60% 省 −55.8%、分层+跨会话最高 −88.4%((五)p.19 图 17)
混布 / 调度 ↔ 集群利用率 UU 从 35%→65% 成本 −46.2%;单租户 22%→38% 省 −42.1%((五)p.20 图 18)。中金:规模侧优势「主要来自需求侧聚合而非技术侧」((五)p.19)——提醒我们:调度这层要绑客户聚合场景(园区/Token 工厂)一起卖
国产卡适配 ↔ 异构硬件适配与调度中金:国内「海外 GPU+多类国产芯片并存+私有化部署」使异构调度商业价值明确((四)p.32);未给国产卡实测折价数(我方 50–70% 锚点仍以标准化研究院口径为准);投机解码新数据:DSpark 使 V4-Flash 生成速度 +60%–85%,120 tok/s SLA 下系统吞吐 +661%((四)p.17-20)

3.2 中金把「利用率」拆成了两个因子——比我们的口径更细,建议采纳

η × U:工程达成率 × 集群利用率((五)p.11, p.18, p.20)

η(引擎工程达成率):通用框架默认只有 10%,成熟引擎低位 30.1% / 中值 60.7% / 高位 91.4%;U(集群利用率):行业基准 30–35%,优化后单租户 38% / 中型平台 65% / 大型公有云 78%
我们过去讲「实际计算利用率 ~30%,优化后 76%」是把两者合着说;中金拆开后话术更锋利:「你的集群哪怕排满了(U 高),引擎那一层可能只兑现了理论吞吐的 10%——η 是我们的主场。」

04 · THE MODEL测算篇:公式、假设全录与成本瀑布(第五篇,2026-08-24)

全系列最值钱的一页纸是这个公式((五)p.11 图 9):

每百万 Token 成本 = GPU 单价($/h)× 277.8 ÷(T 理论吞吐 × M 算法增益 × η 工程达成率 × U 集群利用率) 与我们的成本恒等式(单位 Token 成本 = 卡时成本 ÷ 有效吞吐 × 利用率)完全同构——中金把「有效吞吐」拆成了 T×M×η 三项。分母四个因子,后三个都是我们的产品。

4.1 成本瀑布:44.46 → 0.039 美元(−99.9%,(五)p.12 图 10)

步骤降幅降后成本($/百万)归谁做
基准:稠密 400B、η=10%、U=35%44.46
MoE 化(激活 37B)45%24.58模型厂(架构层)
MHA→MLA82%4.44
3:1 混合注意力24%3.38
权重 FP458%1.42算法层(可外部做)
KV Cache FP823%1.09
投机解码(高并发)18%0.891
推理引擎 η 10%61%84%0.147引擎与调度层(我们的主场)
前缀缓存命中 60%51%0.072
集群利用率 35%65%46%0.039

读法:模型架构层的红利归模型厂,但最后三步(η、缓存、U)合计还有 −96.8% 的空间(0.891→0.039),而这三步恰好是部署方自己做不了、模型厂懒得给每个客户做的——这就是第三方优化的地盘,中金替我们算好了上限。

4.2 假设全录(引用中金数字前先看这张表)

假设取值页码评注
GPU 与卡价B300,租赁 8 美元/卡·时p.13偏保守(其自己的时租表:云厂商 B300 仅 2.26 美元,p.8)——绝对值被系统性抬高,引用降幅比引用绝对值安全
任务形态输入 32,768 + 输出 1,000 tokens;SLO 34 tok/s/用户p.12-13典型 Agent 负载,输入远大于输出
浮点利用率Prefill 50% / Decode 30%p.14, 17行业中性
投机解码草稿 k=3、接受率 α=70%p.17偏乐观(通用负载 α 难到 70%)
η 中值 61%五项优化乘数连乘的中值(连续批处理 1.8–2.5×、分块预填充 1.1–1.3×、PD 分离 1.2–1.5×、FP4 Kernel 1.15–1.5×、通信重叠 1.1–1.25×)p.18偏乐观——中金自注「各项增益均为假设值,不代表同一系统实测」;真实生产很难同时兑现五项
前缀缓存命中 60% 常规 / 单会话全命中 −86% 上限p.19上限是理想值
U基准 30–35%,优化后 38%/65%/78%(单租户/中型/公有云)p.11, 2065–78% 对中小平台偏乐观
硬件时租表H100 1.17–1.78 / H200 1.22–2.05 / B200 1.73–2.60 / GB300 2.31–3.30 / MI355X 1.50–2.10($/卡·时;
云厂商/新云/3 年租赁三档,新云溢价 22–32%)
p.8可直接用作客户成本对标表
需求预测中国 Token 调用量 2026E 0.05 → 2030E 53.21(单位 10^18,沙利文)= 四年 ×1,000p.4比第一篇「5 倍」口径激进得多,引用注明口径

4.3 盈亏实景((五)p.7 图 5——把我们知识库的数字全对上了)

毛利率盘点:MiniMax 企业级 69.4%(综合 25.4%、AI 原生产品仅 4.7%)、智谱综合 41.0%(本地部署 48.8% / 云服务 18.9%)、PPIO 仅 9.4%、Together AI 41.0%;算力方 CoreWeave 71.7%、Nebius 68.6%(折旧占成本 44.8%/74.9%)。硅基流动公有云毛利率 −119%——中金补充的细节比招股书摘要更狠:靠本地部署 82.5% 毛利撑着,且 8,374 万销售费用中 5,421 万是免费 Token 代金券((五)p.7, p.25-26)。我方知识库的两个锚点(MiniMax 69.4%、硅基流动 −119%)与中金完全同源,以后引用可直接标「中金(五)p.7」。

05 · APPLY用法:回写三份材料 + 接住反方观点

5.1 回写清单

目标材料怎么改
工研院提案(sjtu-i3-token-proposal)§6.5 四项进阶技术可补中金页码背书:PD 分离乘数 1.2–1.5×((五)p.18)、MoE Prefill −84.7%((五)p.14)、投机解码 DSpark +60–85%((四)p.17-20);§4 亏钱证据链升级:智谱/MiniMax/硅基流动三个数字全部有了中金出处((三)p.22、(五)p.7/25-26);§2 一亿元算术可加「中金:企业 token 同比 ×320」((一)p.9)
客户地图(compute-centers-2026)第 00 章账一的利用率口径可引中金 U=30–35% 基准((五)p.11);账二「吞吐 +50% = 成本 −33%」获公式级印证((五)p.11);第 06 章 Token 工厂对手表补:PPIO 毛利率仅 9.4%、无问芯穹 37,000P/16 种芯片/53 数据中心/日均千亿 token/融资 22 亿+((五)p.7, 27)
知识库 03/07①「MiniMax 69.4%」标注为企业级口径、出处中金(五)p.7(综合仅 25.4%);②硅基流动 −119% 加中金印证与「免费代金券 5,421 万」细节;③新增 η×U 双因子口径取代单一「利用率」;④中金对模型厂盈利时点(Year5 转正/2029-2030)比我们「出清」叙事温和,对外引用注意语气

5.2 中金的反方观点,与我们的接法(内部预案,非对外话术)

中金原话(带页码)我们怎么接
「vLLM/SGLang 已将连续批处理、PagedAttention、前缀缓存等沉淀为行业基础设施」((四)p.5, 22-23)承认,并顺势:公共基线=η 的 10–30% 档;我们卖的是从 30% 到 61–91% 那一段(中金自己的数字),以及国产卡上「公共基线还没铺到」的部分——LMDeploy 之外,国产多芯片的 Kernel 覆盖仍是洼地((四)p.23, 32)
「头部模型厂普遍自研闭源引擎,原厂调优最懂自家模型」((四)p.23)承认,但客户不是模型厂:园区、Token 中标商、机房方拿到的是开源权重+异构卡,模型厂的闭源引擎不跟着开源权重走——这正是(六)p.4 说的「算力供给有限下的分流需求」,分流的承接方就是我们这类角色
「第三方长期需要向硬件或向模型靠拢」((五)p.1)不反驳,认领。我们就是「向硬件靠拢」的那一支(国产卡深度);中金同页也说异构调度在国内「商业价值明确」((四)p.32)。这句话反而是筛选器:向两头都不靠的纯中间层才是被出清的对象
「规模侧成本优势主要来自需求侧聚合而非技术侧」((五)p.19)所以我们绑聚合场景卖(园区/Token 工厂/中标商),不做散客——与既定打法一致,中金帮我们排除了一条歧路
「新模型换代可能令既有优化投入加速贬值」((四)p.35)如实承认这是真风险;对冲=中金自己给的标准:「新模型发布首日完成算子补齐」的响应能力((四)p.22)是团队能力而非某个模型的资产——尽调时反而是加分项
价值分配:硬件 40% / 云 25% / 模型 30% / 聚合仅 5%((六)p.15);(一)受益名单无第三方优化商(p.10)正视:独立优化层拿不到大比例分成,所以商务结构必须「按节省额分成+私有化交付」抢利润池,而不是当聚合平台赚 5% 的过路费——印证客户地图第 06 章的定价结论

🔒 内部提醒:接法第三条涉及我们与硬件侧的关系,对外表述止于「团队在国产芯片生态有多年工程积累」,原厂背景与两条绝密事项照旧任何场合不提。

APPENDIX附录:文献卡与对照总表

A · 六篇文献卡

日期分析师页数一句话
(一)Agentic AI 驱动 Token 大幅增长2026-05-10于钟海、车姝韵、王之昊15日均 Token 再增 5 倍+,全产业链受益
(二)单位经济模型探讨2026-05-10于钟海、王之昊、袁佳妮13自建 1.95/租赁 2.60 美元每百万,Token 工厂理论毛利 60%
(三)大模型商业模式的中观分析2026-06-18于钟海、王之昊、袁佳妮30B 端 API 确定性最高;2025 实景成本结构盘点(图 29)
(四)推理产业链深度·技术篇2026-08-23车姝韵、童思艺、于钟海39四层 Co-design,单项优化不构成壁垒
(五)推理产业链深度·测算篇2026-08-24车姝韵、李铭娜、于钟海37成本公式四因子,瀑布 −99.9%;η×U 双因子口径
(六)开源模型价值透析2026-08-26于钟海、王之昊、袁佳妮22开源占量 50–70%/占值 12–30%;开源不等于低价

B · 我方六锚点 × 中金口径对照总表

我方锚点中金口径判定
算力租赁 ≈3,000 元/P/月(经观)只有美元/卡时口径:GB200 10$/h×75% 折扣((二)p.2-3);
时租表 H100 1.17–1.78$ 等((五)p.8);
PPIO 现货 H20 ¥3.4/h((五)p.27)
不可直接对标,海外新卡口径系统性更高;保留我方国内锚点
实际计算利用率 ~30%,优化后 76%U 基准 30–35%、优化后 38/65/78%;另拆出 η 10→61→91%((五)p.11, 18, 20)印证,且中金口径更细(η×U),建议采纳
API 均价 21.9 元/百万、一年 +80%(大摩)全球成交均价 $1.88((六)p.10);
国产头部输出价 0.87–5$((三)p.14);
涨价方向:DeepSeek +125%、Kimi 追平 GPT-5.6 Terra((六)p.13)
方向印证;绝对值口径不同(全球 vs 国内、成交 vs 挂牌),引用时分开说
国产 GPU 实际可用算力=标称 50–70%(标准化研究院,东吴引)六篇均未给国产卡折价数;仅定性讲异构适配价值明确((四)p.32)未涉及,锚点维持东吴出处
硅基流动:公有云毛利 −119%、算力支出=收入 2.88 倍119% 中金直接印证并补「免费代金券 5,421 万」((五)p.7, 25-26);2.88 倍未提,但行业参照:海外算力支出=收入 1.5 倍、国内训练=收入 2–4 倍、智谱合计 4.6 倍((三)p.22)印证+升级(以后标中金出处)
智谱云端 −0.4% vs MiniMax 69.4%(MFU>75%)(三)p.22:智谱 19% vs MiniMax 55%(2025 开放平台+API 口径);
(五)p.7:MiniMax 企业级 69.4%、综合 25.4%
智谱云服务 18.9%
方向印证;69.4% 与中金企业级口径同源,引用时必须注明「企业级」,综合口径低得多

抽验记录:本页发布前回原 PDF 核对了(二)p.2 图 1(1.95/1.11/0.13/0.72,单机柜年折旧 101 万美元)与(三)p.22 图 29(33/40/19/55,−108/−116/−439/−318)——与笔记完全一致。原始 PDF:算力/中金报告/