背景关联 本文是中国开源模型性能收敛真正改变了什么的后续篇。如果说前一篇讨论的是性能收敛的价值链含义,本文则用香港披露验证这些低价API在成本结构上是否可持续。建议搭配Kimi K3重塑AI价格曲线、半导体多空之争的真正焦点一起阅读。相关专题为AI HBM专题与Exclusive Analysis专题。
要点
- 当前中国AI API的价格,是结构性降低的成本与战略性亏本竞争混合而成的价格。所有超低价既难以全部维持,也难以完全回归美国前沿模型的水平。
- 香港披露给出了分化的答案。智谱的API毛利率改善至18.9%(上年3.3%),已开始覆盖边际推理成本。但公司整体毛利仅为研发支出的9.3%,完全成本尚未收回。
- 中国的成本优势确实存在,但并非来自华为芯片或廉价电力。其重要性排序是模型结构与激活参数压缩 > 批处理·缓存·量化 > 云端GPU利用率 > 较低的目标利润率 > 电力与国产NPU。
- 即便把电力效应算得很宽松,也只相当于算力价格的约2%。Qwen 3.5 Flash在北京·法兰克福·弗吉尼亚定价相同这一事实,印证了这一点。
- 与电动车不同,AI模型的转换成本很低。如果出现赢者通吃,发生的层面也不是模型,而是云与分发渠道。最可能的路径是低价寡头垄断(60%)。[分析范围]
1. 到底便宜多少
以下是截至2026年7月、每百万token的价格。[事实: 各公司官方价格表]
| 模型 | 输入 | 输出 |
|---|---|---|
| DeepSeek V4 Flash | 0.14美元 | 0.28美元 |
| DeepSeek V4 Pro | 0.435美元 | 0.87美元 |
| Gemini 3.5 Flash | 1.50美元 | 9美元 |
| GPT-5.6 Sol | 5美元 | 30美元 |
DeepSeek V4-Pro的输入价格比GPT-5.6 Sol便宜约11倍,输出价格便宜约34倍。当然,这并不代表性能、延迟、SLA、安全性与工具能力也完全相同。
中国国内价格差异也很大
- Qwen 3.7 Max:输入12元,输出36元,目前5折优惠
- Doubao Seed 2.1 Pro:输入6元,输出30元
- DeepSeek V4-Pro:比中国国内竞争对手还要激进得多
因此,不能把DeepSeek的价格当作中国整体的正常价格。[推断: 价格分散的解读]
2. 可持续的部分:边际成本
DeepSeek V4-Pro是在总计1.6万亿参数中仅激活490亿个的MoE架构。将高利用率与批处理、缓存结合起来,可以大幅降低实际的每token运算成本。重复输入的缓存命中价格,每百万token仅为0.003625美元。[事实: DeepSeek官方资料]
因此,以下这些流量即便按当前价格,在边际成本口径下也可能是可持续的。
- 批处理
- 缓存命中
- 不承诺延迟的流量
- 能维持高利用率的大批量使用
3. 难以持续的部分:完全成本
仅凭目前的公开价格,很难覆盖模型训练费用、研发、失败的实验、闲置产能,以及安全·销售·企业级SLA等成本。
价格正常化其实已经开始。[事实: 各公司举措与报道]
- DeepSeek将V4价格下调75%后,又将高峰时段价格翻倍
- 阿里巴巴也将部分AI服务价格最高上调34%
- 企业专属吞吐量与低延迟服务,定价高于公开API
这证明超低价并不能在所有时段、所有客户群体中都维持下去。
| 服务 | 可持续性 |
|---|---|
| 缓存·批处理·非优先流量 | 高 |
| 高峰时段·低延迟·高并发 | 低 |
| 企业级安全·SLA | 已形成单独的高价收费 |
| 独立API业务的完全成本回收 | 按现价难以实现 |
4. 用公开披露验证:智谱与MiniMax
从这里开始才是本文的核心。我们可以不靠猜测,而是用香港上市公司的披露来加以确认。
| 2025年 | 智谱(02513) | MiniMax(00100) |
|---|---|---|
| 营收 | 7.24亿元人民币 | 7,904万美元 |
| API·平台收入占比 | 26.3% | 32.8% |
| API或整体毛利率 | API 18.9% | 整体25.4% |
| 上年毛利率 | API 3.3% | 整体12.2% |
| 研发/营收 | 439% | 320% |
| 经调整净亏损/营收 | 439% | 317% |
| 毛利/研发 | 9.3% | 7.9% |
[事实: 智谱2025年业绩, MiniMax 2025年年度报告]
智谱:边际成本已确认得到覆盖
API与开放平台收入从4,848万元人民币增至1.904亿元,增幅293%,毛利率也从3.3%升至18.9%。公司将原因归结为推理效率提升、规模经济与价格上调。
更重要的事实是:截至2026年3月,API价格较上年末上调了83%,需求却仍然超过供给。目前GLM-5的官方价格为输入4元、输出18元人民币/百万token。上层API似乎已经摆脱了低于直接推理成本的倾销结构。[推断: 涨价与供不应求的含义]
MiniMax:可能性高但尚未确定
公司并未单独披露API的毛利率。整体毛利率从12.2%改善至25.4%,公司将原因归结为模型与系统效率提升,以及基础设施配置优化。
目前M2.5的价格为输入0.30美元、输出1.20美元/百万token,高速版为0.60美元/2.40美元。但M2.5是2026年才推出的,而披露的损益只涵盖到2025年,因此现价下API单独的成本率尚未得到验证。[未验证]
完全成本两家公司均未收回
智谱整体毛利2.97亿元人民币,仅为研发支出31.80亿元人民币的9.3%。MiniMax的毛利也只有2,008万美元,仅覆盖了2.53亿美元研发支出的7.9%,经营活动现金流出为2.80亿美元。
MiniMax在2025年向阿里巴巴集团采购的服务金额为7,588万美元,相当于营收的96%。这笔金额混合了训练用与服务用的云资源,不能直接等同于API成本,但足以说明其对外部计算基础设施的依赖程度很高。阿里巴巴持有MiniMax 17.06%的股权。
值得注意的是,披露文件明确表示,关联交易是按照向一般客户提供的公开价格与条款进行的。战略关系带来的产能保障与整合便利可以承认,但没有证据可以断定其中存在隐藏的价格补贴。[推断: 披露措辞解读]
上市之后,智谱净募资313.75亿港元,MiniMax通过新股与可转换债券合计净募资159.57亿港元。募集资金大部分投向研发与计算基础设施。融资本身并不能证明API业务亏损,但可以说明前沿模型的竞争,尚未到仅靠内部现金就能维持的阶段。[事实: 公司披露]
判定
- 付费高端API的边际成本可持续性:智谱已确认,MiniMax可能性高但尚未确定
- 含训练费用在内的完全成本可持续性:两家公司均未达到
- 价格战的可持续性:高。凭借资本市场募资,亏本价格也能维持较长时间
- 市场结构:相比赢者通吃,更可能出现像智谱专注中国企业·本地部署、MiniMax专注海外·消费者·多模态这样的分领域寡头垄断
5. 拆解成本优势:真正的原因是什么
中国在API服务成本上的优势确实存在。但关键并不是廉价电力或华为芯片这一项单一因素,而是以下几项的组合。
较小的激活参数规模·量化
+ 较高的批处理率·缓存利用
+ 阿里巴巴等大型云厂商的GPU利用率
+ 较低的目标利润率
+ 中国西部的廉价电力
| 因素 | 成本优势 | 判断 |
|---|---|---|
| 模型结构·量化·缓存 | 非常大 | 中国API价格竞争力的核心 |
| 云规模·利用率 | 大 | 阿里巴巴最确定的护城河 |
| 较低的目标利润率 | 大 | 是价格便宜的原因,但对长期盈利能力是弱点 |
| 华为昇腾 | 中等,有条件 | 在优化过的工作负载中有利,通用性较低 |
| 中国西部电力 | 中等 | 对批处理型推理有效,对全球实时API作用有限 |
| 政府补贴·政策性融资 | 存在 | 有利于产业培育,但具体到每项服务的金额不透明 |
6. 电力真的是决定性因素吗
中国电力便宜是事实。宁夏中卫数据中心的到户电价,按2026年计算为0.36元/千瓦时,约相当于中国东部的45%水平。美国2025年工业用电平均价格为8.62美分/千瓦时,按7.2元/美元的汇率假设折算约为0.62元/千瓦时。中卫电价大约便宜42%。[事实: 中国地方政府资料, 美国EIA]
但仅凭电力,并不能让API价格便宜5倍、10倍。如果把电力效应算得很宽松,假设单卡IT负载1kW、PUE为1.1,结果如下。
中卫: 1kW × 1.1 × 0.36元 = 0.40元/小时
美国平均: 1kW × 1.1 × 0.62元 = 0.68元/小时
差额: 约0.29元/小时
按阿里巴巴给出的L20按量付费价格14.4元/小时计算,即便在这一上限假设下,电力差额也只相当于算力价格的约2%。[推断: 自行测算]
这说明电力虽然重要,但并非API价格差距的主因。
决定性的反证
西部电力优势更适合批处理型推理与训练,但低延迟API必须部署在靠近用户的东部与海外区域。而阿里巴巴的Qwen 3.5 Flash价格,不仅在北京,在法兰克福和弗吉尼亚也同样是输入0.029美元、输出0.287美元/百万token。[事实: 阿里云Model Studio价格表]
这是证明低价API并非单纯源自中国电力的最直接证据。[推断: 跨区域同价的含义]
7. 阿里巴巴真正的护城河是利用率
阿里云的强项与其说是电力,不如说是让GPU不停歇运转的能力。[事实: 阿里巴巴官方文档]
- 批量推理:较标价5折优惠
- L20竞价实例:从按量付费的14.4元降至通常约2.88元左右,约省80%
- 闲置GPU:活跃单价0.000018美元/CU,闲置单价则为0.000007美元/CU
- 混合使用按量付费、竞价实例与自动伸缩来应对峰值流量
不过竞价实例存在被回收的风险,因此不能把SLA要求严格的实时API全部放在竞价实例上运行。基本需求放在按量付费或专属资源上,只有弹性需求才用竞价实例处理,这是目前的结构。[推断: 运营层面的约束]
8. 华为昇腾一定更便宜吗
严格来说,昇腾不是GPU,而是NPU。
华为在CloudMatrix 384上提出以下主张。[事实: 华为官方资料]
- 折算单卡推理吞吐量2,300 tokens/s
- 相比原有非超节点架构约提升4倍
- MFU提升50%以上
- 相比H20,单卡平均推理性能提升3-4倍
这是通过资源池化与MoE专家并行,以系统设计弥补单颗芯片规格较低这一弱点的方式。
但不能直接解读为低成本
- 华为没有公开在相同模型、相同延迟、相同功耗口径下经外部验证的TCO。[未验证]
- CloudMatrix是通过捆绑大量NPU与网络来提升吞吐量的结构,因此单卡吞吐量和整个集群的总成本是两回事。
- 2026年一项针对昇腾910的现场研究发现,为实现稳定推理,需要12个源码补丁、禁用部分高吞吐功能,并配置应对反复故障的装置。即便硬件价格便宜,工程与运维成本也可能随之上升。[事实: 昇腾现场研究]
有条件的判定
| 条件 | 判定 |
|---|---|
| 像Qwen·DeepSeek·GLM那样针对昇腾深度优化的模型 | 可能具备成本竞争力 |
| 直接迁移CUDA架构的模型 | 成本优势不确定 |
| 中国境内大规模批处理推理 | 有利 |
| 全球企业级实时服务 | 若计入软件与SLA成本则尚未确认 |
9. 与电动车有何不同
相似之处在于:都是战略产业,都有大规模投资、大型企业补贴,并通过降价来抢占市场份额。
不同之处在于,AI模型的转换成本要低得多。API规格相近,客户既可以同时路由多个模型,也可以自行运行开源模型。只要有一家厂商涨价,竞争模型与自建托管就会形成价格上限。
相反,将云计算、数据、安全、支付、广告、办公工具捆绑在一起的平台,转换成本很高。如果出现赢者通吃,更可能发生在分发和云这一层,而不是模型本身。[推断: 转换成本结构]
最可能出现的结构如下。
- 阿里巴巴:云计算·电商·企业客户
- 字节跳动:消费者流量·广告·内容
- 腾讯:微信·企业服务
- 华为·百度:国产基础设施与政务·企业客户
- DeepSeek等1-2家独立模型公司:提供技术基准价格
10. 预期路径
| 情景 | 判断概率 | 结果 |
|---|---|---|
| 低价寡头垄断 | 60% | 压缩至3-5家,基础API维持低价,峰值·SLA价格上调 |
| 完全商品化 | 25% | 开源·MoE·自研芯片主导进一步降价 |
| 大幅正常化 | 15% | 芯片·电力·融资负担推动价格上涨2-5倍 |
[推断: 情景推演]
即便价格上涨5倍,DeepSeek V4-Pro的输出价格也约为4.35美元,仍低于美国前沿模型。当前价格或许还不是底部,但低价化的方向已难以逆转。
11. 半导体启示
低价API会增加推理用量,有利于服务器DRAM、NAND、网络与电力需求。但另一方面,它也会降低每token运算量与HBM搭载强度,给高端GPU与HBM的单位经济性带来压力。
| 对象 | 判断 |
|---|---|
| 三星电子 | 通用DRAM·NAND占比高,相对能起到缓冲作用 |
| SK海力士 | 对HBM稀缺性溢价构成长期警示 |
| 英伟达 | 高端GPU单价承压,但总推理量增长是对冲因素 |
| 阿里巴巴·腾讯 | 受益点在于云与分发生态的扩张,而非API利润率 |
核心不在于API价格的下降幅度,而在于整体token用量的增长速度。如果用量增长快于价格下降,杰文斯效应就会占上风;反之,高端GPU与HBM的估值倍数将率先下调。[推断: 方向判断]
12. 决定性验证在于2026年上半年的披露
- 智谱的API毛利率在83%涨价之后,能否升至25-30%以上
- MiniMax是否会公开API成本率
- 营收增速能否持续跑赢计算成本增速
- 峰值·SLA费率与公开API费率之间的差距是否固化
- 华为是否会公开相同条件下经外部验证的TCO
这五项指标,将区分"可持续的成本"与"靠资本硬撑的价格"。
结语
中国API价格低廉,并不是因为这已是能够自立的正常价格。而是推理效率改善与庞大的资本募集共同支撑的结果。
中国在国内、批处理型、经过优化的模型服务方面,拥有结构性的成本优势。但目前观察到的极端低价API,不能仅用华为芯片和廉价电力来解释。按重要性排序,最大的成本优势依次是模型规模与激活参数压缩、批处理·缓存·量化、云端GPU利用率、较低的目标利润率,电力与国产NPU则排在其后。
从投资角度看,中国低价API并不直接等同于"中国AI已经建立起压倒性的成本护城河"。更准确的解读是:推理服务正在快速商品化,模型公司的利润率随之走低,价值则更可能向云、电力、半导体基础设施一侧转移。
这会给西方模型厂商的API利润率带来压力,但由于募集资金又重新投入训练与计算基础设施,并不意味着半导体总需求会下降。
本文综合香港上市公司披露(智谱02513 2025年业绩·新股配售,MiniMax 00100 2025年年度报告·融资)、各公司官方价格表(DeepSeek、OpenAI、Google、阿里云Model Studio、火山引擎、智谱BigModel、MiniMax Platform)、华为官方资料与CloudMatrix相关研究、中国地方政府电力资料、美国EIA统计数据撰写而成。MiniMax的API单独成本率与华为同口径外部验证TCO均未公开,情景概率与电力测算为撰写时点的假设。所提及标的为示例,非买卖建议。价格与披露数据以发布时点为准,此后可能发生变化。投资判断与责任由投资者本人承担。