中国AI API定价可持续吗:用公开披露验证成本结构与赢者通吃情景

DeepSeek V4-Pro的输出价格比GPT-5.6 Sol低34倍。这是可持续的定价,还是像电动车那样走向赢者通吃的过程?用智谱与MiniMax的香港披露来验证,答案一分为二:付费高端API已开始覆盖边际推理成本,但两家都尚未收回含训练费用的完全成本。中国的成本优势并非华为芯片或廉价电力,而是模型结构、批处理、缓存与云端利用率的组合,电价差异仅相当于算力价格的约2%。

背景关联 本文是中国开源模型性能收敛真正改变了什么的后续篇。如果说前一篇讨论的是性能收敛的价值链含义,本文则用香港披露验证这些低价API在成本结构上是否可持续。建议搭配Kimi K3重塑AI价格曲线半导体多空之争的真正焦点一起阅读。相关专题为AI HBM专题Exclusive Analysis专题

要点

  • 当前中国AI API的价格,是结构性降低的成本与战略性亏本竞争混合而成的价格。所有超低价既难以全部维持,也难以完全回归美国前沿模型的水平。
  • 香港披露给出了分化的答案。智谱的API毛利率改善至18.9%(上年3.3%),已开始覆盖边际推理成本。但公司整体毛利仅为研发支出的9.3%完全成本尚未收回
  • 中国的成本优势确实存在,但并非来自华为芯片或廉价电力。其重要性排序是模型结构与激活参数压缩 > 批处理·缓存·量化 > 云端GPU利用率 > 较低的目标利润率 > 电力与国产NPU
  • 即便把电力效应算得很宽松,也只相当于算力价格的约2%。Qwen 3.5 Flash在北京·法兰克福·弗吉尼亚定价相同这一事实,印证了这一点。
  • 与电动车不同,AI模型的转换成本很低。如果出现赢者通吃,发生的层面也不是模型,而是云与分发渠道。最可能的路径是低价寡头垄断(60%)。[分析范围]

核心论点
中国API价格低廉,并非因为这已是能够自立的正常价格,而是推理效率改善与庞大的资本募集共同支撑的结果。这会给西方模型厂商的API利润率带来压力,但由于募集资金又重新投入训练与计算基础设施,并不意味着半导体总需求会下降。

1. 到底便宜多少

以下是截至2026年7月、每百万token的价格。[事实: 各公司官方价格表]

模型输入输出
DeepSeek V4 Flash0.14美元0.28美元
DeepSeek V4 Pro0.435美元0.87美元
Gemini 3.5 Flash1.50美元9美元
GPT-5.6 Sol5美元30美元

DeepSeek V4-Pro的输入价格比GPT-5.6 Sol便宜约11倍,输出价格便宜约34倍。当然,这并不代表性能、延迟、SLA、安全性与工具能力也完全相同。

中国国内价格差异也很大

  • Qwen 3.7 Max:输入12元,输出36元,目前5折优惠
  • Doubao Seed 2.1 Pro:输入6元,输出30元
  • DeepSeek V4-Pro:比中国国内竞争对手还要激进得多

因此,不能把DeepSeek的价格当作中国整体的正常价格。[推断: 价格分散的解读]


2. 可持续的部分:边际成本

DeepSeek V4-Pro是在总计1.6万亿参数中仅激活490亿个的MoE架构。将高利用率与批处理、缓存结合起来,可以大幅降低实际的每token运算成本。重复输入的缓存命中价格,每百万token仅为0.003625美元。[事实: DeepSeek官方资料]

因此,以下这些流量即便按当前价格,在边际成本口径下也可能是可持续的。

  • 批处理
  • 缓存命中
  • 不承诺延迟的流量
  • 能维持高利用率的大批量使用

3. 难以持续的部分:完全成本

仅凭目前的公开价格,很难覆盖模型训练费用、研发、失败的实验、闲置产能,以及安全·销售·企业级SLA等成本。

价格正常化其实已经开始。[事实: 各公司举措与报道]

  • DeepSeek将V4价格下调75%后,又将高峰时段价格翻倍
  • 阿里巴巴也将部分AI服务价格最高上调34%
  • 企业专属吞吐量与低延迟服务,定价高于公开API

这证明超低价并不能在所有时段、所有客户群体中都维持下去。

服务可持续性
缓存·批处理·非优先流量
高峰时段·低延迟·高并发
企业级安全·SLA已形成单独的高价收费
独立API业务的完全成本回收按现价难以实现

4. 用公开披露验证:智谱与MiniMax

从这里开始才是本文的核心。我们可以不靠猜测,而是用香港上市公司的披露来加以确认。

2025年智谱(02513)MiniMax(00100)
营收7.24亿元人民币7,904万美元
API·平台收入占比26.3%32.8%
API或整体毛利率API 18.9%整体25.4%
上年毛利率API 3.3%整体12.2%
研发/营收439%320%
经调整净亏损/营收439%317%
毛利/研发9.3%7.9%

[事实: 智谱2025年业绩, MiniMax 2025年年度报告]

智谱:边际成本已确认得到覆盖

API与开放平台收入从4,848万元人民币增至1.904亿元,增幅293%,毛利率也从3.3%升至18.9%。公司将原因归结为推理效率提升、规模经济与价格上调。

更重要的事实是:截至2026年3月,API价格较上年末上调了83%,需求却仍然超过供给。目前GLM-5的官方价格为输入4元、输出18元人民币/百万token。上层API似乎已经摆脱了低于直接推理成本的倾销结构。[推断: 涨价与供不应求的含义]

MiniMax:可能性高但尚未确定

公司并未单独披露API的毛利率。整体毛利率从12.2%改善至25.4%,公司将原因归结为模型与系统效率提升,以及基础设施配置优化。

目前M2.5的价格为输入0.30美元、输出1.20美元/百万token,高速版为0.60美元/2.40美元。但M2.5是2026年才推出的,而披露的损益只涵盖到2025年,因此现价下API单独的成本率尚未得到验证。[未验证]

完全成本两家公司均未收回

智谱整体毛利2.97亿元人民币,仅为研发支出31.80亿元人民币的9.3%。MiniMax的毛利也只有2,008万美元,仅覆盖了2.53亿美元研发支出的7.9%,经营活动现金流出为2.80亿美元。

MiniMax在2025年向阿里巴巴集团采购的服务金额为7,588万美元,相当于营收的96%。这笔金额混合了训练用与服务用的云资源,不能直接等同于API成本,但足以说明其对外部计算基础设施的依赖程度很高。阿里巴巴持有MiniMax 17.06%的股权。

值得注意的是,披露文件明确表示,关联交易是按照向一般客户提供的公开价格与条款进行的。战略关系带来的产能保障与整合便利可以承认,但没有证据可以断定其中存在隐藏的价格补贴。[推断: 披露措辞解读]

上市之后,智谱净募资313.75亿港元,MiniMax通过新股与可转换债券合计净募资159.57亿港元。募集资金大部分投向研发与计算基础设施。融资本身并不能证明API业务亏损,但可以说明前沿模型的竞争,尚未到仅靠内部现金就能维持的阶段。[事实: 公司披露]

判定

  1. 付费高端API的边际成本可持续性:智谱已确认,MiniMax可能性高但尚未确定
  2. 含训练费用在内的完全成本可持续性:两家公司均未达到
  3. 价格战的可持续性:。凭借资本市场募资,亏本价格也能维持较长时间
  4. 市场结构:相比赢者通吃,更可能出现像智谱专注中国企业·本地部署、MiniMax专注海外·消费者·多模态这样的分领域寡头垄断

5. 拆解成本优势:真正的原因是什么

中国在API服务成本上的优势确实存在。但关键并不是廉价电力或华为芯片这一项单一因素,而是以下几项的组合。

较小的激活参数规模·量化
+ 较高的批处理率·缓存利用
+ 阿里巴巴等大型云厂商的GPU利用率
+ 较低的目标利润率
+ 中国西部的廉价电力
因素成本优势判断
模型结构·量化·缓存非常大中国API价格竞争力的核心
云规模·利用率阿里巴巴最确定的护城河
较低的目标利润率是价格便宜的原因,但对长期盈利能力是弱点
华为昇腾中等,有条件在优化过的工作负载中有利,通用性较低
中国西部电力中等对批处理型推理有效,对全球实时API作用有限
政府补贴·政策性融资存在有利于产业培育,但具体到每项服务的金额不透明

6. 电力真的是决定性因素吗

中国电力便宜是事实。宁夏中卫数据中心的到户电价,按2026年计算为0.36元/千瓦时,约相当于中国东部的45%水平。美国2025年工业用电平均价格为8.62美分/千瓦时,按7.2元/美元的汇率假设折算约为0.62元/千瓦时。中卫电价大约便宜42%。[事实: 中国地方政府资料, 美国EIA]

但仅凭电力,并不能让API价格便宜5倍、10倍。如果把电力效应算得很宽松,假设单卡IT负载1kW、PUE为1.1,结果如下。

中卫:      1kW × 1.1 × 0.36元 = 0.40元/小时
美国平均:  1kW × 1.1 × 0.62元 = 0.68元/小时
差额:                             约0.29元/小时

按阿里巴巴给出的L20按量付费价格14.4元/小时计算,即便在这一上限假设下,电力差额也只相当于算力价格的约2%。[推断: 自行测算]

这说明电力虽然重要,但并非API价格差距的主因。

决定性的反证

西部电力优势更适合批处理型推理与训练,但低延迟API必须部署在靠近用户的东部与海外区域。而阿里巴巴的Qwen 3.5 Flash价格,不仅在北京,在法兰克福和弗吉尼亚也同样是输入0.029美元、输出0.287美元/百万token。[事实: 阿里云Model Studio价格表]

这是证明低价API并非单纯源自中国电力的最直接证据。[推断: 跨区域同价的含义]


7. 阿里巴巴真正的护城河是利用率

阿里云的强项与其说是电力,不如说是让GPU不停歇运转的能力。[事实: 阿里巴巴官方文档]

  • 批量推理:较标价5折优惠
  • L20竞价实例:从按量付费的14.4元降至通常约2.88元左右,约省80%
  • 闲置GPU:活跃单价0.000018美元/CU,闲置单价则为0.000007美元/CU
  • 混合使用按量付费、竞价实例与自动伸缩来应对峰值流量

不过竞价实例存在被回收的风险,因此不能把SLA要求严格的实时API全部放在竞价实例上运行。基本需求放在按量付费或专属资源上,只有弹性需求才用竞价实例处理,这是目前的结构。[推断: 运营层面的约束]


8. 华为昇腾一定更便宜吗

严格来说,昇腾不是GPU,而是NPU

华为在CloudMatrix 384上提出以下主张。[事实: 华为官方资料]

  • 折算单卡推理吞吐量2,300 tokens/s
  • 相比原有非超节点架构约提升4倍
  • MFU提升50%以上
  • 相比H20,单卡平均推理性能提升3-4倍

这是通过资源池化与MoE专家并行,以系统设计弥补单颗芯片规格较低这一弱点的方式。

但不能直接解读为低成本

  • 华为没有公开在相同模型、相同延迟、相同功耗口径下经外部验证的TCO。[未验证]
  • CloudMatrix是通过捆绑大量NPU与网络来提升吞吐量的结构,因此单卡吞吐量和整个集群的总成本是两回事
  • 2026年一项针对昇腾910的现场研究发现,为实现稳定推理,需要12个源码补丁、禁用部分高吞吐功能,并配置应对反复故障的装置。即便硬件价格便宜,工程与运维成本也可能随之上升。[事实: 昇腾现场研究]

有条件的判定

条件判定
像Qwen·DeepSeek·GLM那样针对昇腾深度优化的模型可能具备成本竞争力
直接迁移CUDA架构的模型成本优势不确定
中国境内大规模批处理推理有利
全球企业级实时服务若计入软件与SLA成本则尚未确认

9. 与电动车有何不同

相似之处在于:都是战略产业,都有大规模投资、大型企业补贴,并通过降价来抢占市场份额。

不同之处在于,AI模型的转换成本要低得多。API规格相近,客户既可以同时路由多个模型,也可以自行运行开源模型。只要有一家厂商涨价,竞争模型与自建托管就会形成价格上限。

相反,将云计算、数据、安全、支付、广告、办公工具捆绑在一起的平台,转换成本很高。如果出现赢者通吃,更可能发生在分发和云这一层,而不是模型本身。[推断: 转换成本结构]

最可能出现的结构如下。

  • 阿里巴巴:云计算·电商·企业客户
  • 字节跳动:消费者流量·广告·内容
  • 腾讯:微信·企业服务
  • 华为·百度:国产基础设施与政务·企业客户
  • DeepSeek等1-2家独立模型公司:提供技术基准价格

10. 预期路径

情景判断概率结果
低价寡头垄断60%压缩至3-5家,基础API维持低价,峰值·SLA价格上调
完全商品化25%开源·MoE·自研芯片主导进一步降价
大幅正常化15%芯片·电力·融资负担推动价格上涨2-5倍

[推断: 情景推演]

即便价格上涨5倍,DeepSeek V4-Pro的输出价格也约为4.35美元,仍低于美国前沿模型。当前价格或许还不是底部,但低价化的方向已难以逆转。


11. 半导体启示

低价API会增加推理用量,有利于服务器DRAM、NAND、网络与电力需求。但另一方面,它也会降低每token运算量与HBM搭载强度,给高端GPU与HBM的单位经济性带来压力。

对象判断
三星电子通用DRAM·NAND占比高,相对能起到缓冲作用
SK海力士对HBM稀缺性溢价构成长期警示
英伟达高端GPU单价承压,但总推理量增长是对冲因素
阿里巴巴·腾讯受益点在于云与分发生态的扩张,而非API利润率

核心不在于API价格的下降幅度,而在于整体token用量的增长速度。如果用量增长快于价格下降,杰文斯效应就会占上风;反之,高端GPU与HBM的估值倍数将率先下调。[推断: 方向判断]


12. 决定性验证在于2026年上半年的披露

  • 智谱的API毛利率在83%涨价之后,能否升至25-30%以上
  • MiniMax是否会公开API成本率
  • 营收增速能否持续跑赢计算成本增速
  • 峰值·SLA费率与公开API费率之间的差距是否固化
  • 华为是否会公开相同条件下经外部验证的TCO

这五项指标,将区分"可持续的成本"与"靠资本硬撑的价格"。


结语

中国API价格低廉,并不是因为这已是能够自立的正常价格。而是推理效率改善与庞大的资本募集共同支撑的结果。

中国在国内、批处理型、经过优化的模型服务方面,拥有结构性的成本优势。但目前观察到的极端低价API,不能仅用华为芯片和廉价电力来解释。按重要性排序,最大的成本优势依次是模型规模与激活参数压缩、批处理·缓存·量化、云端GPU利用率、较低的目标利润率,电力与国产NPU则排在其后。

从投资角度看,中国低价API并不直接等同于"中国AI已经建立起压倒性的成本护城河"。更准确的解读是:推理服务正在快速商品化,模型公司的利润率随之走低,价值则更可能向云、电力、半导体基础设施一侧转移

这会给西方模型厂商的API利润率带来压力,但由于募集资金又重新投入训练与计算基础设施,并不意味着半导体总需求会下降


本文综合香港上市公司披露(智谱02513 2025年业绩·新股配售,MiniMax 00100 2025年年度报告·融资)、各公司官方价格表(DeepSeek、OpenAI、Google、阿里云Model Studio、火山引擎、智谱BigModel、MiniMax Platform)、华为官方资料与CloudMatrix相关研究、中国地方政府电力资料、美国EIA统计数据撰写而成。MiniMax的API单独成本率与华为同口径外部验证TCO均未公开,情景概率与电力测算为撰写时点的假设。所提及标的为示例,非买卖建议。价格与披露数据以发布时点为准,此后可能发生变化。投资判断与责任由投资者本人承担。


相关文章

使用 Hugo 构建
主题 StackJimmy 设计