TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:; c$ f% o1 c0 ~% P+ F' ^( X/ O) Q$ S4 l
2 s( B# W+ [& K+ w4 e一、总体分析框架与核心结论2 g! G9 p5 y. q- e1 E' L
1.1 分析框架概览
4 L/ X2 T0 X% g9 q拆分维度+ b: u) ]- i/ E; v& n
: K) @8 g, o8 e, X' D
阶段:
. J8 u5 ]; ~1 u5 n/ f/ D6 z( S. x建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
+ [* k1 N+ D- e: l k运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等& h! K0 b2 B' t9 p2 f$ H/ G$ z
区域:
% a- B; V' y9 c% u/ `中国、美国、欧洲、中东(以海湾地区/UAE 为代表)) W& F9 ] J4 Y# I/ c) B
技术方案:: ?3 _0 }" @, t
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)- O( X R" c( J4 W+ R! J7 E0 j
Google TPU(v5e/v5p/Trillium 等)8 V% ~$ L! t6 p& I ]
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
$ W4 y+ ?5 j% a1 E1 |算例基准6 n0 A7 ?+ F! f2 e
" D3 F6 |8 u2 c& V
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:: L7 E. g2 L1 J1 F7 ~0 o
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW! s. i( k1 p- D+ C. g
PUE 假设约 1.11(高效液冷场景)[1][29]
; r i0 `# W$ n3 A, A6 M* O6 s$ P时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
1 J$ J8 X/ Y& c7 r- s9 G. Q5 e关键指标
7 t$ U0 y9 o" }& [. P0 w4 M) a d! o- p0 Z. U$ P; |1 _; t( |
$/MW 建设成本(含/不含 IT 硬件)0 O; {, h+ s+ r. m5 Q& y
$/kWh 电力成本、L/kWh 水耗" B; B6 m) b" ^$ g1 j" M
$/token 或 $/百万 token 的综合成本
% C; \9 Y' R1 K WToken-per-watt / Joule-per-token 作为能效基准[17][18][26]
% Y; j% g7 c+ @% _ l项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
3 D( S( q$ t8 P# N+ H$ i4 D: I1.2 高层结论(供决策快速参考)
( Q/ T3 ?- U( o建设成本:AI 数据中心相对传统云数据中心成本翻倍; u; L& t; j5 \% Q4 r B6 \& r
. W) W" g1 ~ p- O传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。: P' V* Q b& w
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。6 ~, e) C& Y# [( i1 R% v5 [
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。/ m6 a, Z) S, O8 @( c
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
% p5 W. _6 V, _' f0 E# O! d9 {' @8 {3 {+ D) M0 K# W% U+ j) y. p: ^
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13], `6 r) w# V$ A: T
美国:$8–12M/MW,400 MW 约 $4.0B[1]
- q0 X' W) [+ {7 z" I3 D欧洲:接近全球平均 $10.7–11.3M/MW[2][41]( e3 w% P# ^0 k
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
/ j2 F! {1 p& _结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
( N* {# e' n! f: BOPEX:电价与人工决定区域优势; V3 B" E. U; V; o
' K5 d ~3 E m* E& t( e电价(2025–2026 工商业大致区间):/ j2 H; B2 K0 q, x
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]+ \. @2 U2 W) v4 a9 \3 q
美国:工业用电约 $0.085–0.09/kWh[44]
8 D+ A6 I2 S @% W/ P" I# J# |欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
$ b/ c# d$ i4 t% A4 R中东/UAE:工业用户 $0.07–0.13/kWh[47]
1 \( i$ d; S# I! {9 D" [人工:9 q5 k' C% }2 D1 X/ ?6 O
中国数据中心运维:约 $22k/人/年" R, B/ z" J$ c, b5 E
美国数据中心运维:约 $120k/人/年[1]5 E: V8 V# s1 x, r+ r
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。 B. F8 D8 t( J" f& b
能耗与每 token 能源成本:能效差异远大于电价差异
$ Y! O; w; E. d g. a+ J
2 P3 d/ u% j& V2 M: wIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。7 f3 B5 v* u$ e0 g
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。/ [: h( _: s5 h/ K" z* ~3 }1 P
将 token 能耗约化为统一口径:
4 R* B( @# b( N. ^粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:- N7 ~1 S3 k. ]6 _( Z+ O
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
+ e6 {3 h& z* o4 R+ y. y; ?; S美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token. C+ l* L# n0 o0 V. H' ~1 k+ g" m
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
" o h7 E. g$ t; X4 p不同芯片方案的核心差异
- U# g* U$ h/ C! Q K9 y
1 k1 e N t! W4 W4 P7 pNVIDIA Blackwell/B200 & GB200 NVL72:; f+ |# n2 ? i7 J# v Q
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。( U& ?/ N# g8 q& }( @: h3 S+ @4 W
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。$ D5 F) m& a$ Z# t! |
Google TPU v5e/v5p/Trillium:
3 l3 S% x2 @/ {" |! Q9 @2 WTPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。% Z5 v7 C7 y1 v c8 w; s
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
) V8 Z! q# G5 e' `' S# f0 B华为昇腾 910B:8 S* g6 c; p- T9 {3 i6 p$ ?1 C% f
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。8 c/ n5 Z. N9 M3 x- |
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。 i, X' i+ W+ i0 z* ?, ]6 G, k! c
阿里平头哥真武 810E(Zhenwu PPU):/ j; T* L5 X% e
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
" ^1 t" G8 N8 d8 }; ~6 q结论:) y/ g. R0 h8 P5 M# O
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。* Z5 G) C2 z- _7 I4 \! \4 k+ L
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
+ V- r5 K1 x/ F2 U& d8 L# h对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
3 v9 f# p' ]! F- j' D, x( d自建 vs 云租的 TCO 与 token 成本
0 X/ j# h2 F: w4 }9 H) F! O$ A4 w8 V% }% p F. }1 |6 R
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
- |7 g, h, j. L8 I6 O8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
; v4 [, ^( R6 M5 ~) Y等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。, R0 s# v4 z& K
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
/ W" L# S3 k7 lToken 成本对比示例(LenovoPress 场景)[28]:
* U9 B1 _% _" q& u4 z( B: cLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
5 b# R1 U! I+ z7 a3 Zvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。4 [. p2 q4 r X% N$ `
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
! C! ]0 |1 B+ N: h2 Y# ~0 u+ bLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。) ^! R/ E2 g# B! D9 K7 ?
结论:
" ?% Z/ s# N8 b' T/ q; c高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
; B5 `1 m! W# ^ M A f; V- iToken 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
7 M' I! h' N/ z二、建设期成本分布:区域对比! S! O: c4 u/ L
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
( _7 L) w7 h, E* E3 I0 o' d/ @! X# Q4 ]
2.1 全球/通用结构(以 1 MW 为单位)" z" F# a' L4 Z7 w0 G
综合 JLL、ConstructElements 等[2][41][40]:7 M# X/ V4 a! J- o: j" T. o0 y
7 n5 P# z, C7 w7 \1 J壳体+机电(Shell & Core)! \7 ] u, {0 V0 J' J3 ^
* l c$ K# j1 L% [' w2 B* s- E! ]
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
6 A* N7 b, _) A& h其中按成本构成[40]:6 I7 b/ O$ J: z/ D5 o
电力系统(变电、配电、UPS、母线等):40–50%
2 y6 ?6 u- f% s, O. R机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
& @- M+ }) C. ?; [& y `- ?建筑与土地、结构:约 15–20%
6 K" d' k8 n+ k( T# b5 ^3 Z7 E' @9 }2 O其他(消防、安防、楼宇管理等):约 10–15% V, X4 q% e; d' O* P& S8 s
IT 内装与 AI 基础设施(不含芯片)) C. b1 \) ~1 k3 h
& b9 U. `5 o' V" q n! |高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。7 P# |6 P0 S7 B8 L9 Z. ?8 ]8 x' J
GPU/加速卡硬件 CAPEX. h4 k. [& m% {% [/ g
+ C6 B3 W i- V/ n& K多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。7 B0 {- r7 Q! |* ~ D0 B
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
& x4 Q+ T+ R [* }) N1 X" Y结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):, Y' A8 V3 w" e- Q8 K
4 J' C; _$ y8 N区域 典型建设成本(壳体+机电,$M/MW) 备注" d3 F3 }6 u5 u! R
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
/ [: B! o$ t$ `) M, W W2 p美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
( E/ E, v; A: f欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
$ W. |& @8 @( Z; q中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]1 W6 g5 n3 @4 \, G
结论:
( `) G3 i, R1 h1 V' B0 W! h0 z! A& B
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
, C' D6 c( O; K" q( o若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
0 E4 H+ ^$ b( y: h0 y2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)4 i0 t3 M. v3 p# C( P
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:5 h0 U5 Y I8 \
7 o9 j; \* `# X+ M
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
% m+ F4 o% h$ H+ I3 t! ~ Z/ b K% HGPU 配置:6 v, J0 S, d% r: I8 d8 \% ]* P2 e
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
- v" t4 R W' ?# Y( \, E每 rack 成本 ≈ $3.0–3.35M[34][69];0 P9 {2 d, f2 X ] Y6 \! ~
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。, L* f4 ` P7 I
与不同区域壳体+机电组合:8 c$ [) ^5 T- \1 ], c0 q
6 \1 ?; F0 n4 }. I以中值估算:, G1 v5 z- U l
0 y' T6 Q% o7 M6 T% }$ V* P Z
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B% u* X; d5 x% b$ ^9 u5 C1 z. d' s
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
* \& B% X! `" j: T2 [# c4 q) W欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
! x: T& V8 v2 u: L中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B& S1 x$ Z' ?0 Y
可见:
5 x4 N) d) [, ?9 S6 |6 p& T: _& L9 `( ~; q5 `4 Z
GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。6 k0 u0 j" [; _5 ~: r( _* u2 [/ |
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
& W5 }+ j6 E* v& k }三、运营期成本结构与区域对比
& T* f* P4 I1 i. _$ B/ H7 V* D0 {6 X3.1 通用 OPEX 结构(高密 AI DC)
$ p5 j% S! m, a1 C" P$ [6 E结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
# v& p& D+ P2 C$ |! G2 ~/ z/ f: x9 W1 [) D* L3 o( c T2 U# Y: ]
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。
* Z6 v& ]0 B1 f' K8 z冷却与水资源:0 z3 p- g6 [; v" r6 Q/ b3 C
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。/ U4 g w6 |2 M9 l
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
3 m! |; q1 _ \3 J* n2 v+ Z' A人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
8 l6 i `% J: R8 O; V) f6 O托管/物业与维护:% k: E& Z! B/ m; |! A
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];5 m5 u8 W( Q) q# O( [
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
1 t' E) d; I, b5 c3.2 区域差异(以 400MW / 3 年期为例)" {1 _! Z! k+ R: z" x g- \
使用 ChinaTalk 的电费与人工估算[1]:% P9 T: o4 Y8 X% E+ H: o7 o& e
) w5 q# \8 ~ `+ r电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:! ^ F5 C! L! n5 e# j: \' h
中国:约 $0.06/kWh → 3 年电费 ≈ $350M1 S7 F" |# G3 i, g2 d+ m
美国:约 $0.09/kWh → 3 年电费 ≈ $600M+ Z1 U. O' S. {4 w
中东:约 $0.07–0.10/kWh → $400–550M7 D' u, X: ]) {3 t8 S
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
8 {& k6 H. L. Q! m! s" ~水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:
# O8 p* O3 P8 {8 R美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
* ?/ ^% s# U5 O6 E三年水费级别:
+ K. ^; V8 u- X. @8 y; E$ p美国:$40k+
9 q2 _# `( H1 m X& Q. S7 `中国:$20k+
! y( b) |! F3 p* V7 B3 e% J" n8 m6 C结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
! X O, K7 a% p2 W人员成本(3 年) – 假设 500 名全职运维:
7 t. p! a% ^ l; f+ Q美国:500 × $120k × 3 = $180M+' \0 F! U0 N. H. q7 T' K
中国:500 × $22k × 3 = $33M+
/ q/ m/ }4 B5 h* w9 P" v& q# r差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
/ G' `. ]" B0 r6 O1 G整体 OPEX 粗算(3 年) – 400MW 场景下:
' j# o( L5 Y ^( n* D
; b% w2 w5 n/ p" A" ]" K项目 中国 美国
, _4 v- \) {; b; L, `8 G电费 $350M $600M
) J7 V4 g9 D: s/ }3 l' i4 {水费 <$0.05M <$0.05M' \* O4 Z4 \* B2 n, W; T# V* i
人员 $33M $184M' D, V& o8 B; Y& ^
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 ( p' L) s! I/ _6 }# F0 |
结论:
4 D' b0 \, |, u" G$ r i# O: V: m2 Y
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
% K. g: \( ~4 {* O对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
2 M) F! H; L! P4 Y- y# V0 I! s四、基于 token 的成本与利润推演# q% }( b7 |. T
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)8 n: A/ r8 _7 f2 H" q
统一假设:' y0 J0 i5 {* V. m/ M/ f
8 z6 W) g/ w6 S
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18]), A1 _; h( l/ R
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh2 W* z5 U% Z: }% a' [
1 百万 token:278 Wh = 0.278 kWh3 n J1 E% ]' o _' _- c* M
场景 A:美国电价 $0.30/kWh' r% s$ T: O/ X& }
电费/百万 token = 0.278 kWh × $0.30/kWh* f1 F% e! Q# M8 }2 [% h, G
≈ $0.0834 / 百万 token
6 m; F% B: s* a5 E场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
; E$ ~" t% Y( p电费/百万 token = 0.278 kWh × $0.042
- _9 V) g2 _1 ?2 S9 A/ f# F6 `≈ $0.0117 / 百万 token" z4 p! u, A) d( ~, U
对比当前 API 价格(OpenAI 2026Q1)[62]& A7 L/ j' S+ E J) Q
以输出侧为主(成本最敏感):# n3 f ~$ B) R' q
0 b% M6 K, Z4 S
模型 输出价 ($/百万 token): r2 e/ }. s8 o0 n6 e
GPT‑5.2 $14
}7 p; U! f' J8 c, J; Y0 bGPT‑5.2 Pro $168
+ r5 X7 k. m1 i+ `GPT‑4.1 $8
0 ~ p' H1 S" \1 ~2 O! `" hGPT‑4o $10/ `) J4 c; x+ B6 `. i+ a k% O
GPT‑4o mini $0.60
% `8 D' x0 q; c" L( d9 }) T则:; I* ]' U! Q. Q2 p; K k
, w: l8 V# C$ |! @& k6 E0 k$ |在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
" z& y4 ?& |# i, ~% |; h在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。" C* `9 S6 \- H5 c: r. ?' j) a
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
2 R5 r4 @9 N. W& a* p/ Q( Y结论:
$ s Q9 O- D" V5 M即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
5 R: |/ V6 x- E' K4 P+ r; j9 J
( T3 K0 I; z' D6 m* r7 d4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
( r" p, D# m+ _: D9 s7 _: O以 LenovoPress 的 8×H100 Config A 为例[28]:
' }7 B6 e5 g2 f- r2 i0 ~
! ?# @6 C: f* c: J: [5 J5 年摊销下,8×H100 本地推理 70B 模型:" x: ?9 p9 j2 _! F2 j
小时综合成本(CapEx摊销+Opex):$12.08/h
+ o# k ?, g, V9 A: y3 _吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens" u a/ {$ e: u5 D, M0 j+ q! w+ L
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
" @5 Z8 O; L6 X2 _0 |电费在其中的占比:
9 j- w9 @, \6 ?( ^3 \* HOpex 6.37$/h 中电力+冷却约 $0.87/h[28]& I, k: ?' G7 t5 g4 B7 w
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
& t# o. E e X& B1 d0 T电费占 总 token 成本 ~7% 左右。( g: g2 c/ @5 A3 ^* {
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。9 `: f9 W1 }6 m/ N% F
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。; r% q6 x) e3 R4 U0 T1 |* l
9 Y# A0 K7 n/ u8 ?
因此:
/ K+ t, p/ Y) R' [, {% H0 W0 V k3 g& J, g
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。8 X/ h% y" E! v) w
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。5 i- s$ g$ ^* t
五、不同芯片方案的建设与运营成本对比: K. f' d6 Z7 Y# J! n$ P
5.1 NVIDIA 方案(H100/H200/B200/GB200)
0 q0 q9 r/ N! zCAPEX:1 {2 _7 \# L7 j8 O
( o7 q2 Z& Y1 Z c) s
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。 {8 o C/ i9 U
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
8 N; ?; `2 |8 q& I* i. W+ v$ NB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。/ b' M/ B6 a9 p8 _( H
GB200 NVL72:
' I4 H- }& }+ M1 l每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。. W$ N5 j8 A! W4 j* |& o' _/ G
冷却系统每 rack 额外 $50–56k[35]。
; \ d; o' ^; j: y( `+ O在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。, ?8 K/ K5 P3 \- ]
OPEX & 能效:4 u* i7 o6 z9 a5 ^0 Y7 U
! J; ]- j: [! v6 t+ E0 y+ Z, H单 GPU 功耗:
/ ?3 H8 z/ r* j; MH100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
# b2 B2 |3 E' c- vH200:功耗类似或稍高,但性能/W 提升[9][10]。/ ~4 B0 S8 B' G: Y% B* H
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。* \2 O( R1 J% h5 a; Q
Token 性能:( W8 N- b: j9 f2 I$ M" R, g) H
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
+ [5 @4 ~- Y- E8 _4 S' iNVIDIA 的优势:$ z3 o2 k8 H4 p& Z8 L/ k
" m }. p' f4 Y0 \2 Q6 d
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。: `. j+ x9 {9 P; X3 X9 e# w3 t% w
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
8 l$ q/ y7 }7 a' x# o; ]' E5.2 Google TPU 方案# x9 _2 o. `6 E# E/ u+ `' w
CAPEX:
q% i7 i- U9 `# j$ m# w% D9 G6 B7 Z+ R( V6 k* o
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。) z" Z9 }$ J) _
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。4 Y9 E& A `! X3 m2 M; }1 N
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。6 W+ ]- L; P4 \# ^/ o1 g; ]3 ~4 L
能效:' N$ f) \# x: b0 T
' p9 `; f4 ?8 b. X* I- f. {" e1 G$ A; `
TPU v5e vs H100:1 b8 i1 \* k! M+ x8 R
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
: h# L4 o# k! b' x- D9 x. z测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。! Z! u: y) ]1 j
新一代 Trillium/TPU v7:& q" g& F/ ]* Y0 V
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
1 t$ J& J2 t7 A: U* e2 Q; [Google 方案的特点:; i X: r3 h C
* t$ q) c- l! M) d5 D; }6 e. Z2 n自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;3 @3 n6 w$ e \
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。/ [; d* f* G# _. X+ l, E
5.3 华为昇腾 910B / 910C 方案) R* Y b& u; D/ M. {$ N
CAPEX:, W2 p' p: Z- ^" n0 h
: ^) j& L7 l2 ?; _/ _0 r7 G
单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
+ o4 j3 x5 ]( y% n- C% k$ l与 A100 对比:
4 {8 l& b( o. S( M; ?0 w/ XFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
( e8 z( M% k) J, {5 T& Z) J市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
) Q. F/ S2 F1 y' E0 c2 E使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。# a8 @+ e$ d5 b4 C
OPEX & 能效:& `( g3 c7 @- b3 n5 q
; H& }8 B I( d0 ]7 {910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。! o! U# R1 S* Q6 O4 @$ q# _" X
部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。+ l, |: L$ ^6 Y ~! I' D' b8 z
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
. i& C/ l0 d! q5 V0 Q9 I5.4 平头哥真武 810E(PPU)方案
/ s) c; K" T' @6 a0 |; qCAPEX:
1 J2 O7 g* V+ J% w U% u& ], _4 T9 G
技术参数:. G/ R; W1 n( _4 ]: x
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。3 s9 A q- ^; g) A3 V& P
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
1 n6 [0 k, a: J* }4 k5 ^! b3 a+ k价格:
. i4 E& w" H. v, G3 ]& @% |% M. T$ ]未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。5 c- U$ V8 w5 N ?4 k' Q4 z
结合国内报道:
. a4 q9 A& V/ z2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。6 Q% l. Z( N! p8 F( E& l, v
数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
! ? ^* q6 C; D% A g7 I+ COPEX & 能效:) ]) P" y) K" v- u
: S+ m2 }; r1 \400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;+ } s: {3 _ s; T3 d7 Q
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
/ A' s, z8 C+ h5 |六、综合比较与策略建议0 [6 u8 Y2 H# a2 c8 ^# n7 p
6.1 区域维度:在哪里建 AI 数据中心?
2 @" u8 f! B' h8 V: Z8 v( Y纯经济性(TCO/tokens)排序(假设无政策/合规约束):
4 O9 W7 l( P/ z& h5 m1 m. v% t/ Z1 B( A
中国西部/北部(电价低、人力低、建设成本低): `7 K! Y) \" H0 n
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)" g( h0 P4 j. S& F9 l
美国电价低但人工高;东海岸/加州电价上涨压力大
( w3 j) `: n9 B! P" R欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
9 R, Q5 a" T3 K, ~/ j' ~: T若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:$ K: {- T8 e, S! G
9 W. {) w& f5 p9 q+ ~- j2 V
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;1 X6 W+ e, v6 w# L
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
. @) h0 R% n& L* q# X* E但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。) [0 C' [+ [) q# \ j' g' M# ]
6.2 技术栈维度:选哪家芯片/云栈?, e5 L( s+ H. J% I) o9 j" |
若目标是全球最优 tokens/$ 且不受出口管制:
; r ~9 Y3 ]! W. ]. |
8 {* b* D0 c0 W; IGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。; @8 _7 ^2 B7 ~ W& j& ~6 U
若在美国/欧洲,能自由采购 NVIDIA:3 F8 q8 ~1 I# K8 |4 w. U
& P. `, n* }$ g# w+ V! o% d4 `7 @
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践: S# J( _8 A/ W9 Z6 b; B
成熟的软件栈与生态,极高的 tokens/s/GPU;$ Y: e) ^6 b' C. a2 Z4 O; ~
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;1 O1 s, B0 T" ~" n9 j+ F w# f
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。3 ^4 N- l' ^& l o: Y/ u
若在中国或存在出口管制约束:- ?9 N4 E) p- G- O
4 ]7 o1 m+ I' d% G昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:/ ~0 K9 S8 |+ F3 B' H% ~
性能上已能覆盖大部分 GPT‑4 类推理需求;
B+ Z: F- c# H4 W f6 r, I5 {单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
( Z5 ~8 h7 x3 f- E$ c, }7 }( l7 x软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
# `0 Q/ x) V3 _3 |' j6 Z( |0 w, S: E建议配合:
6 a- i8 N, B5 k/ Y0 I高效液冷(PUE~1.1)、' O9 c4 z6 m2 M# r. D" c
大 batch、路由(浅层任务走小模型/低成本芯片)、# s$ \% T. R$ k) f$ w* S' U# z' n
强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。/ O- u, \1 P. ?
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
C2 K _% B# _6 O; k4 ]
( t, \4 H& u& ~0 M2 t4 ]数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];% `2 a7 g. T2 m
这意味着:
" O5 i1 p) W& {4 C! i$ Z; O优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
4 v' Z7 b6 I" [精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。6 y+ f1 i$ F6 x1 [7 i5 {1 F
6.3 针对你关心的具体问题的简要回答
4 x+ \) q) U6 I0 Y# M- Z6 n7 g$ {AI 数据中心建设 vs 运营成本的大体比例?8 A$ R+ E: B: X7 R7 L4 R
& ` f, s2 W# [2 D3 Z- }, a在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
& G3 H+ n4 m$ f5 ]; z. ~- A: H其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。: D- H# h* J* R& o8 R! \7 t4 ]
中国、美国、欧洲、中东的成本结构区别?
' I' K! b$ w) J( R6 |3 o
% g! Y3 ^4 R( n4 s/ R( K1 T3 I' F5 O建设期:
( g0 |0 D& F) v) c, G* {中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。2 s/ Y _6 Q; K1 ~+ ~ F
运营期:; g3 M% ]/ n3 d2 n, f' T( _
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
- b4 x1 ?: I2 K人工:中 国 ≪ 美 欧,中东居中。7 f0 t7 A4 c8 `% f6 _% G, B
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?3 e( Z7 N. U8 }7 U4 Y7 p6 d% s6 x
- u( ? i+ u ~( [2 ~" P对于典型 1 J/token 推理负载: ?5 a. O# m. f8 n5 T% f
美国 $0.30/kWh:电费约 $0.083/M token
& v5 n1 _+ J0 M中国 0.3 元/kWh:电费约 $0.012/M token
/ }1 p$ z9 f3 T; `9 o7 q. [- A/ }对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。' y* W* ~' Q7 P2 ?& Z ^
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
* R2 C. f8 f1 n7 W/ g& e" s9 V b+ k/ G, ]! R1 i
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;. B o) b8 H) g( v6 ^8 S! Q; [1 a
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;- X& I7 b* p4 m' E$ |3 x. E, }$ I
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|