六篇 156 页,压成一页可用的:每个数字带页码,每个结论后面跟用法;与我方既有锚点逐条印证或冲突。原文存于 算力/中金报告/。
六篇的骨架一句话:(一)token 还要涨 5 倍 →(二)理论上卖 token 毛利 60% →(三)现实是国内头部亏 −318%~−439% →(四)差距由四层技术决定 →(五)公式与瀑布:成本可压 99.9% →(六)开源把量做大、把价托住。合读的结论:token 是门好生意,但只对能把「理论 60%」兑现出来的人——中金把兑现路径逐项标了价。
| (一)05-10 | Agent 单任务是对话的数十倍 token,全国日均 140 万亿只是起点,还有 5 倍以上空间(p.3, 7-8) |
|---|---|
| (二)05-10 | NVL72 口径:自建 1.95 / 租赁 2.60 美元/百万 token;全卖 token 理论经营利润率 60%+,只出租仅 20%(p.2, 6-7) |
| (三)06-18 | 2025 实景:API 毛利率 OpenAI 33% / Anthropic 40% / 智谱 19% / MiniMax 55%,亏损率 −108% ~ −439%;模型厂约 Year5 转正(p.22, 26) |
| (四)08-23 | 推理优化=模型架构/算法/引擎/异构调度四层 Co-design,单项不构成壁垒;PD 分离实证最高 +498% 有效承载(p.4-5, 25-28) |
| (五)08-24 | 成本公式四因子,瀑布 44.46→0.039 美元(−99.9%);其中引擎 η、缓存、利用率 U 三步(部署侧可做)合计 −96.8%(p.11-12) |
| (六)08-26 | 2027 开源占全球 token 量 50–70% 但价值量仅 12–30%;开源不等于低价(DeepSeek 输出价 +125%);推理调优平台 Fireworks/Together/Baseten ARR 各约 10 亿美元、估值百亿级(p.1, 8, 13, 17) |
「中金测算:用通用开源框架部署,引擎工程达成率默认只有 10%,成熟引擎能到 61%——你的集群哪怕排满,理论吞吐可能九成没兑现。」((五)p.18)比「利用率 30%」更锋利,因为它把责任从「没客户」切到「没工程」。
「模型架构的红利归模型厂;但引擎、缓存、利用率三步——从 0.891 到 0.039 美元——是部署方自己做不了、模型厂不会替你做的。」((五)p.12 图 10)
「做这件事的 Fireworks / Together / Baseten,ARR 各约 10 亿美元、估值 83–175 亿美元;Together 引擎较 vLLM 数倍吞吐。」((六)p.8, 17)给园区、给投资人的估值对标,出自中金而非我们自己。
①vLLM/SGLang 已把多数通用优化沉淀为公共基线;②头部模型厂自研闭源引擎,「原厂调优」最懂自家模型;③测算篇观点直言:第三方是阶段性抢身位,「长期需要向硬件或向模型靠拢」((四)p.5, 22-23;(五)p.1)。这三条不反驳,要接住——我们的答案正是「向硬件靠拢」那一支。
中金的核心判断:日均 Token 消耗还有 5 倍以上增长空间,驱动力从 Chatbot 换成 Agent——单任务计算载荷是对话的数十倍。对我们:这条曲线是所有客户「产能焦虑」的来源,开场引用它,比讲技术更快对齐。
厂商样本:豆包日均 120 万亿(3 个月翻倍,两年 ×1,000);MiniMax 单日消耗 2 个月 ×6,coding plan ×10;智谱 coding plan 半年 ×15(p.3)。海外收入侧:Anthropic ARR 四个月 90→300 亿美元(+230%),OpenAI 250 亿美元(p.3)。中国模型全球周调用 4.12 万亿 首超美国 2.94 万亿(2026-02,p.8)。
① 对机房方:「中金测的是还有 5 倍——你担心的不该是没需求,是需求来了接不住、接住了不挣钱。」
② 对园区/工研院:「企业侧 token 同比 ×320,孵化项目的 token 账单只会更陡——一亿元预算按今天的单价规划,明年就不够。」
③ 对 Token 中标商:「Agent 情景下输入:输出=8:1、缓存占比 50%(p.4 图 3)——你的成本结构会向 Prefill 与缓存倾斜,这正是 PD 分离与缓存工程的主场。」
口径注意:中金第一篇的受益名单(智谱、MiniMax、金山云、万国数据、世纪互联、网宿、深信服,p.10)里没有任何第三方优化服务商——这个「缺席」在第 05 章展开。
三篇合起来回答一个问题:token 这门生意的钱在哪一层。中金的答案:理论上 Token Factory 毛利率可到 60%,现实里国内头部亏损率还在 −318% 到 −439%——理论与现实之间那道沟,就是推理效率,也就是我们。
| 口径 | 每百万 Token 成本 | 构成与假设 |
|---|---|---|
| 自建(Capex) | 1.95 美元 | 折旧 1.11 + 电费 0.13 + 其他 0.72;单机柜 Capex 650 万美元、年输出 0.91 万亿 tokens(第二篇 p.2 图 1) |
| 租赁(Opex) | 2.60 美元 | GB200 10 美元/卡时 × 75% 折扣,单机柜年租 240 万美元(p.2-3 图 2) |
| 卖 Token | 售价 4–5 美元 | 全部产 Token → API 经营利润率可超 60%; 全部出租只有 20%; 租算力产 Token 溢价约 40%(p.6-7 图 6) |
关键假设(第 04 章有全录,先记三个):折旧 5 年(计算设备)、有效 Tokens 利用率 40%、GB200 吞吐 1,000 tokens/s(弹性极大,p.2-3)。40% 这个假设高于行业实测的 ~30%——中金自己也称这是「理论毛利率」;理论 60% 与现实亏损的差,就差在这类假设兑现不了。
| 厂商 | API 毛利率 | 推理成本/收入 | 训练成本/收入 | 亏损率 |
|---|---|---|---|---|
| OpenAI | 33% | 67% | 99% | −108% |
| Anthropic | 40% | 60% | 91% | −116% |
| 智谱 | 19% | 81% | 378% | −439% |
| MiniMax | 55% | 45% | 249% | −318% |
与我方招股书口径对照:方向完全一致(MiniMax 显著优于智谱),幅度不同——我方口径智谱云端 −0.4% vs MiniMax 69.4%,中金口径 19% vs 55%(年份与分部口径差异)。两套口径都指向同一句话:同样的卡、同样的模型档位,推理效率决定谁的毛利率是谁的三倍。中金补充的机制解释(第三篇 p.24):MiniMax M3 自研 MSA 使百万上下文单 token 计算量降至上代 1/20;DeepSeek V4 单 token FLOPs 仅 27%、KV Cache 仅 10%。盈利时间表:中金假设模型 Year5 营业利润率转正、Year8 达 42%;Anthropic/OpenAI 分别 2029/2030 年盈利(p.25-26)。
中金定义推理调优平台的核心:「不是卖 GPU 算力,而是 FP8/FP4 量化、蒸馏、FlashAttention/Kernel Fusion、Continuous Batching、PagedAttention、KV Cache、投机采样等全栈技术,以同等 GPU/Memory 资源提供更多 Token 产出,降低终端客户单位推理成本」——并给出实绩:Fireworks 量化提升 30%–50%,Together 引擎较 vLLM 数倍吞吐。这三家就是我们的海外估值对标:百亿美元级。对投资人、对工研院,这一页比我们自己说一百句都管用。
同页的冷水也要喝:第三方 API 挂牌价比官方贵约 4 倍(DeepSeek 官方 0.44/0.87 vs 三家 1.74/3.48 美元,p.17 图 19)——第三方从来不是靠价格赢,是靠吞吐、SLA 与私有化;以及价值分配里硬件 40%/云 25%/模型 30%/聚合仅 5%(p.15)。中金整体叙事是「走向盈利」,比我们「出清定生死」的口径温和——引用时注意语气差。
技术篇的框架是四层:模型架构 → 优化算法 → 推理引擎 → 异构调度(p.4 图 1)。结论一句话:「未来领先厂商的核心竞争力来自模型、推理框架与硬件之间的持续 Co-design」——单项优化不构成壁垒。下表把中金的技术项、收益数字与我方七项优势逐项对上:凡是有中金页码的,谈判里就不用我们自证了。
| 我方优势 ↔ 中金技术项 | 中金给的量化收益与出处 |
|---|---|
| 大 EP / MoE ↔ MoE 与专家并行 | MoE 使 Prefill 成本 −84.7%(稠密 400B $0.85 → MoE 671B/37B $0.13,(五)p.14 图 12);EP 的瓶颈=热门专家拖慢整轮,优化点是拓扑感知路由/层次化 All-to-All/通信计算重叠/在线负载均衡((四)p.29-31)——正是我们做的脏活 |
| PD 分离 ↔ Prefill/Decode 分置 | 引擎乘数 1.20–1.50×((五)p.18 图 16);Mooncake 实证:Kimi 集群请求承载 +107%~115%,SLO 约束下有效承载最高 +498%;K2 在 128×H200 上 PD 分离+大 EP:Prefill 22.4 万 / Decode 28.8 万 tok/s((四)p.25-28) |
| Megakernel / 算子优化 ↔ 专用 Kernel 与算子融合 | 中金无「megakernel」一词,表述为:专用 Kernel、算子融合、避免高精度回退与冗余访存;「新模型发布首日完成算子补齐」是引擎竞争重点((四)p.10、p.22);FP4 Kernel 覆盖度单独作 1.15–1.50× 乘数((五)p.18) |
| 量化 ↔ FP8/FP4/INT 系 | B300 实测 FP4 吞吐 ≈ FP8 的 2 倍、BF16 的 3.5–4 倍((四)p.14-16);成本表:权重 FP4+KV FP8 较 FP8/FP16 −60.8%((五)p.16 图 14) |
| 长上下文 ↔ 稀疏/混合注意力 + KV 压缩 + 前缀缓存 | 3:1 混合注意力:128K 上下文降本 −51%、512K −62.5%((五)p.15 图 13);MLA 的 KV 是 MHA 的 1/25、成本 −96%((五)p.13 图 11);Agent 任务前缀缓存命中 60% 省 −55.8%、分层+跨会话最高 −88.4%((五)p.19 图 17) |
| 混布 / 调度 ↔ 集群利用率 U | U 从 35%→65% 成本 −46.2%;单租户 22%→38% 省 −42.1%((五)p.20 图 18)。中金:规模侧优势「主要来自需求侧聚合而非技术侧」((五)p.19)——提醒我们:调度这层要绑客户聚合场景(园区/Token 工厂)一起卖 |
| 国产卡适配 ↔ 异构硬件适配与调度 | 中金:国内「海外 GPU+多类国产芯片并存+私有化部署」使异构调度商业价值明确((四)p.32);未给国产卡实测折价数(我方 50–70% 锚点仍以标准化研究院口径为准);投机解码新数据:DSpark 使 V4-Flash 生成速度 +60%–85%,120 tok/s SLA 下系统吞吐 +661%((四)p.17-20) |
η(引擎工程达成率):通用框架默认只有 10%,成熟引擎低位 30.1% / 中值 60.7% / 高位 91.4%;U(集群利用率):行业基准 30–35%,优化后单租户 38% / 中型平台 65% / 大型公有云 78%。
我们过去讲「实际计算利用率 ~30%,优化后 76%」是把两者合着说;中金拆开后话术更锋利:「你的集群哪怕排满了(U 高),引擎那一层可能只兑现了理论吞吐的 10%——η 是我们的主场。」
全系列最值钱的一页纸是这个公式((五)p.11 图 9):
| 步骤 | 降幅 | 降后成本($/百万) | 归谁做 |
|---|---|---|---|
| 基准:稠密 400B、η=10%、U=35% | — | 44.46 | — |
| MoE 化(激活 37B) | −45% | 24.58 | 模型厂(架构层) |
| MHA→MLA | −82% | 4.44 | |
| 3:1 混合注意力 | −24% | 3.38 | |
| 权重 FP4 | −58% | 1.42 | 算法层(可外部做) |
| KV Cache FP8 | −23% | 1.09 | |
| 投机解码(高并发) | −18% | 0.891 | |
| 推理引擎 η 10%→61% | −84% | 0.147 | 引擎与调度层(我们的主场) |
| 前缀缓存命中 60% | −51% | 0.072 | |
| 集群利用率 35%→65% | −46% | 0.039 |
读法:模型架构层的红利归模型厂,但最后三步(η、缓存、U)合计还有 −96.8% 的空间(0.891→0.039),而这三步恰好是部署方自己做不了、模型厂懒得给每个客户做的——这就是第三方优化的地盘,中金替我们算好了上限。
| 假设 | 取值 | 页码 | 评注 |
|---|---|---|---|
| GPU 与卡价 | B300,租赁 8 美元/卡·时 | p.13 | 偏保守(其自己的时租表:云厂商 B300 仅 2.26 美元,p.8)——绝对值被系统性抬高,引用降幅比引用绝对值安全 |
| 任务形态 | 输入 32,768 + 输出 1,000 tokens;SLO 34 tok/s/用户 | p.12-13 | 典型 Agent 负载,输入远大于输出 |
| 浮点利用率 | Prefill 50% / Decode 30% | p.14, 17 | 行业中性 |
| 投机解码 | 草稿 k=3、接受率 α=70% | p.17 | 偏乐观(通用负载 α 难到 70%) |
| η 中值 61% | 五项优化乘数连乘的中值(连续批处理 1.8–2.5×、分块预填充 1.1–1.3×、PD 分离 1.2–1.5×、FP4 Kernel 1.15–1.5×、通信重叠 1.1–1.25×) | p.18 | 偏乐观——中金自注「各项增益均为假设值,不代表同一系统实测」;真实生产很难同时兑现五项 |
| 前缀缓存 | 命中 60% 常规 / 单会话全命中 −86% 上限 | p.19 | 上限是理想值 |
| U | 基准 30–35%,优化后 38%/65%/78%(单租户/中型/公有云) | p.11, 20 | 65–78% 对中小平台偏乐观 |
| 硬件时租表 | H100 1.17–1.78 / H200 1.22–2.05 / B200 1.73–2.60 / GB300 2.31–3.30 / MI355X 1.50–2.10($/卡·时; 云厂商/新云/3 年租赁三档,新云溢价 22–32%) | p.8 | 可直接用作客户成本对标表 |
| 需求预测 | 中国 Token 调用量 2026E 0.05 → 2030E 53.21(单位 10^18,沙利文)= 四年 ×1,000 | p.4 | 比第一篇「5 倍」口径激进得多,引用注明口径 |
毛利率盘点:MiniMax 企业级 69.4%(综合 25.4%、AI 原生产品仅 4.7%)、智谱综合 41.0%(本地部署 48.8% / 云服务 18.9%)、PPIO 仅 9.4%、Together AI 41.0%;算力方 CoreWeave 71.7%、Nebius 68.6%(折旧占成本 44.8%/74.9%)。硅基流动公有云毛利率 −119%——中金补充的细节比招股书摘要更狠:靠本地部署 82.5% 毛利撑着,且 8,374 万销售费用中 5,421 万是免费 Token 代金券((五)p.7, p.25-26)。我方知识库的两个锚点(MiniMax 69.4%、硅基流动 −119%)与中金完全同源,以后引用可直接标「中金(五)p.7」。
| 目标材料 | 怎么改 |
|---|---|
| 工研院提案(sjtu-i3-token-proposal) | §6.5 四项进阶技术可补中金页码背书:PD 分离乘数 1.2–1.5×((五)p.18)、MoE Prefill −84.7%((五)p.14)、投机解码 DSpark +60–85%((四)p.17-20);§4 亏钱证据链升级:智谱/MiniMax/硅基流动三个数字全部有了中金出处((三)p.22、(五)p.7/25-26);§2 一亿元算术可加「中金:企业 token 同比 ×320」((一)p.9) |
| 客户地图(compute-centers-2026) | 第 00 章账一的利用率口径可引中金 U=30–35% 基准((五)p.11);账二「吞吐 +50% = 成本 −33%」获公式级印证((五)p.11);第 06 章 Token 工厂对手表补:PPIO 毛利率仅 9.4%、无问芯穹 37,000P/16 种芯片/53 数据中心/日均千亿 token/融资 22 亿+((五)p.7, 27) |
| 知识库 03/07 | ①「MiniMax 69.4%」标注为企业级口径、出处中金(五)p.7(综合仅 25.4%);②硅基流动 −119% 加中金印证与「免费代金券 5,421 万」细节;③新增 η×U 双因子口径取代单一「利用率」;④中金对模型厂盈利时点(Year5 转正/2029-2030)比我们「出清」叙事温和,对外引用注意语气 |
| 中金原话(带页码) | 我们怎么接 |
|---|---|
| 「vLLM/SGLang 已将连续批处理、PagedAttention、前缀缓存等沉淀为行业基础设施」((四)p.5, 22-23) | 承认,并顺势:公共基线=η 的 10–30% 档;我们卖的是从 30% 到 61–91% 那一段(中金自己的数字),以及国产卡上「公共基线还没铺到」的部分——LMDeploy 之外,国产多芯片的 Kernel 覆盖仍是洼地((四)p.23, 32) |
| 「头部模型厂普遍自研闭源引擎,原厂调优最懂自家模型」((四)p.23) | 承认,但客户不是模型厂:园区、Token 中标商、机房方拿到的是开源权重+异构卡,模型厂的闭源引擎不跟着开源权重走——这正是(六)p.4 说的「算力供给有限下的分流需求」,分流的承接方就是我们这类角色 |
| 「第三方长期需要向硬件或向模型靠拢」((五)p.1) | 不反驳,认领。我们就是「向硬件靠拢」的那一支(国产卡深度);中金同页也说异构调度在国内「商业价值明确」((四)p.32)。这句话反而是筛选器:向两头都不靠的纯中间层才是被出清的对象 |
| 「规模侧成本优势主要来自需求侧聚合而非技术侧」((五)p.19) | 所以我们绑聚合场景卖(园区/Token 工厂/中标商),不做散客——与既定打法一致,中金帮我们排除了一条歧路 |
| 「新模型换代可能令既有优化投入加速贬值」((四)p.35) | 如实承认这是真风险;对冲=中金自己给的标准:「新模型发布首日完成算子补齐」的响应能力((四)p.22)是团队能力而非某个模型的资产——尽调时反而是加分项 |
| 价值分配:硬件 40% / 云 25% / 模型 30% / 聚合仅 5%((六)p.15);(一)受益名单无第三方优化商(p.10) | 正视:独立优化层拿不到大比例分成,所以商务结构必须「按节省额分成+私有化交付」抢利润池,而不是当聚合平台赚 5% 的过路费——印证客户地图第 06 章的定价结论 |
🔒 内部提醒:接法第三条涉及我们与硬件侧的关系,对外表述止于「团队在国产芯片生态有多年工程积累」,原厂背景与两条绝密事项照旧任何场合不提。
| 篇 | 日期 | 分析师 | 页数 | 一句话 |
|---|---|---|---|---|
| (一)Agentic AI 驱动 Token 大幅增长 | 2026-05-10 | 于钟海、车姝韵、王之昊 | 15 | 日均 Token 再增 5 倍+,全产业链受益 |
| (二)单位经济模型探讨 | 2026-05-10 | 于钟海、王之昊、袁佳妮 | 13 | 自建 1.95/租赁 2.60 美元每百万,Token 工厂理论毛利 60% |
| (三)大模型商业模式的中观分析 | 2026-06-18 | 于钟海、王之昊、袁佳妮 | 30 | B 端 API 确定性最高;2025 实景成本结构盘点(图 29) |
| (四)推理产业链深度·技术篇 | 2026-08-23 | 车姝韵、童思艺、于钟海 | 39 | 四层 Co-design,单项优化不构成壁垒 |
| (五)推理产业链深度·测算篇 | 2026-08-24 | 车姝韵、李铭娜、于钟海 | 37 | 成本公式四因子,瀑布 −99.9%;η×U 双因子口径 |
| (六)开源模型价值透析 | 2026-08-26 | 于钟海、王之昊、袁佳妮 | 22 | 开源占量 50–70%/占值 12–30%;开源不等于低价 |
| 我方锚点 | 中金口径 | 判定 |
|---|---|---|
| 算力租赁 ≈3,000 元/P/月(经观) | 只有美元/卡时口径:GB200 10$/h×75% 折扣((二)p.2-3); 时租表 H100 1.17–1.78$ 等((五)p.8); PPIO 现货 H20 ¥3.4/h((五)p.27) | 不可直接对标,海外新卡口径系统性更高;保留我方国内锚点 |
| 实际计算利用率 ~30%,优化后 76% | U 基准 30–35%、优化后 38/65/78%;另拆出 η 10→61→91%((五)p.11, 18, 20) | 印证,且中金口径更细(η×U),建议采纳 |
| API 均价 21.9 元/百万、一年 +80%(大摩) | 全球成交均价 $1.88((六)p.10); 国产头部输出价 0.87–5$((三)p.14); 涨价方向:DeepSeek +125%、Kimi 追平 GPT-5.6 Terra((六)p.13) | 方向印证;绝对值口径不同(全球 vs 国内、成交 vs 挂牌),引用时分开说 |
| 国产 GPU 实际可用算力=标称 50–70%(标准化研究院,东吴引) | 六篇均未给国产卡折价数;仅定性讲异构适配价值明确((四)p.32) | 未涉及,锚点维持东吴出处 |
| 硅基流动:公有云毛利 −119%、算力支出=收入 2.88 倍 | −119% 中金直接印证并补「免费代金券 5,421 万」((五)p.7, 25-26);2.88 倍未提,但行业参照:海外算力支出=收入 1.5 倍、国内训练=收入 2–4 倍、智谱合计 4.6 倍((三)p.22) | 印证+升级(以后标中金出处) |
| 智谱云端 −0.4% vs MiniMax 69.4%(MFU>75%) | (三)p.22:智谱 19% vs MiniMax 55%(2025 开放平台+API 口径); (五)p.7:MiniMax 企业级 69.4%、综合 25.4%; 智谱云服务 18.9% | 方向印证;69.4% 与中金企业级口径同源,引用时必须注明「企业级」,综合口径低得多 |
抽验记录:本页发布前回原 PDF 核对了(二)p.2 图 1(1.95/1.11/0.13/0.72,单机柜年折旧 101 万美元)与(三)p.22 图 29(33/40/19/55,−108/−116/−439/−318)——与笔记完全一致。原始 PDF:算力/中金报告/。