TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:2 B% w( s5 [! f f. `% t1 Z
1 D5 V: D% a5 q. `
一、总体分析框架与核心结论
/ S i) G. u' F9 A1.1 分析框架概览
/ R M8 ?( l$ f( V5 Z. q+ V拆分维度: Q0 w6 [) \0 m6 \' G
. p- o# ?: L+ D' a6 g8 p, M阶段:
3 @7 \' `; I$ z4 \建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施4 k& b% o' l5 m/ n7 ~
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等# p$ R M" ?) J! B: E
区域:
+ d( p9 t, ?- [. u# `8 r, T n {; |中国、美国、欧洲、中东(以海湾地区/UAE 为代表)9 m" t6 G8 @& Q* l3 F( m
技术方案:- w% Z( x2 C5 t" f6 w
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)& X# o/ j1 a" w
Google TPU(v5e/v5p/Trillium 等)
l6 h& L# ?' m Q1 O% b中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU). i: P% A2 p9 A: T g8 m5 a/ {
算例基准0 M5 W* O2 b( A( f
5 B0 I! b7 _" H f! \* n以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
: _. g1 C4 E, M6 V: T4 [其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW: E& u u. V( I: @
PUE 假设约 1.11(高效液冷场景)[1][29]" n& `* H y& l- e& n6 E
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
& V- C; F9 G [3 s$ v关键指标) o0 O% a: B0 N
% O6 a" l& V% v' a$/MW 建设成本(含/不含 IT 硬件)% }5 } `4 m+ H0 |
$/kWh 电力成本、L/kWh 水耗
& b" n6 Y4 J3 W4 r: H0 x8 _ _$/token 或 $/百万 token 的综合成本5 h8 e" r, c$ ?8 F( q( P, H3 F, q
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]
6 p' {5 N l8 E9 G% K# k8 K项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
# Z- I$ n# O" P5 R1.2 高层结论(供决策快速参考)# _. a' G! w, x
建设成本:AI 数据中心相对传统云数据中心成本翻倍
0 c/ Y# o9 U" s6 }* V- A/ W
7 C2 b4 p& {: q) _传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。0 E' s0 [+ _ ^( P& P
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
1 u$ v! i, ^' B& V' _按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。7 Q. h, P# D. c# U) Y2 [
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
% v3 V5 s6 x$ e/ o2 b0 D: B# }& f+ U( Z) ^$ f+ Y3 t4 g6 p
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]$ g! p, o0 A8 D+ C( Q
美国:$8–12M/MW,400 MW 约 $4.0B[1]
5 B% O7 ^8 F& \+ Z欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
' i4 n3 U) Q8 ?' l# H1 q$ }% _中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
@& @* @5 O E: e) _4 S结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
3 L& }8 }7 O1 x) ^) oOPEX:电价与人工决定区域优势, {% N" F" V1 a, [
# L: d. s+ _2 e电价(2025–2026 工商业大致区间):1 Z4 X+ _8 i4 R8 t
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
) u M) ?, }2 R- \美国:工业用电约 $0.085–0.09/kWh[44]
6 F) t# q/ ~4 i) f) H: I2 V* J欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]" A) ]$ C, N" W7 v9 c4 O$ `
中东/UAE:工业用户 $0.07–0.13/kWh[47]% o9 H [/ x. W0 A0 B' d
人工:
) }( e- x+ _) A中国数据中心运维:约 $22k/人/年; ^( F3 J0 y( k ^
美国数据中心运维:约 $120k/人/年[1]
a% i- n% F& \结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。$ r, p% r! r5 Y- _
能耗与每 token 能源成本:能效差异远大于电价差异
& V5 ~. z h5 }) [, M- ]* R/ O1 ], B( i
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
5 _+ f5 ?; V- ^1 g大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
) e* b1 U- Q1 X* q+ F: O将 token 能耗约化为统一口径:
1 L, [: O9 u1 x1 y2 U7 A! H# t粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:0 @0 R+ G9 y" I. S; b h
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token& I+ Y: A- a7 I! C& A+ b$ w
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token3 [/ A9 ~/ `. x9 T
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。% |5 d) \+ R- j& y; m9 Q/ I$ O4 A
不同芯片方案的核心差异
. _) [4 }+ D3 Z/ a2 k0 M7 r- l- X& k. ]$ g7 Z* {% j- f
NVIDIA Blackwell/B200 & GB200 NVL72:
1 T0 f- }/ [7 C! ]+ o单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。% l7 z; B& O9 }: l- O+ q
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
$ a# I4 N. B- z1 A9 s% }6 J' @Google TPU v5e/v5p/Trillium:6 L2 @* ?' b0 J1 d2 @
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
v! v l1 R2 C T- BGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。, T: z; r( y7 b! I) o
华为昇腾 910B:
P6 u& f- l+ J; B, O' @FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
- J/ M, E" J+ u& ^5 N, B单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。3 N) j2 l6 v: ~3 E8 i
阿里平头哥真武 810E(Zhenwu PPU):
$ z& p6 k0 `# G9 r% Y G7 U6 r+ ~96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。5 U1 [ Q% D1 ?
结论:
/ V! [7 D: i3 \" L能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
: z. h5 r) C( h$ r2 ?( g2 @5 D- T单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
5 u/ l. H# v: \ D, L2 O& H$ Y对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。! s5 F3 Y, C1 S# e) q
自建 vs 云租的 TCO 与 token 成本+ f: ~4 W6 M6 u
6 v6 g6 h# t4 hLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
/ w2 ]8 q! w8 g* T7 Z; h8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
1 R) H& S' H; U% E4 a) D等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。* C$ s/ P$ Y/ n/ |" [
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
' M8 c4 n" E. g* mToken 成本对比示例(LenovoPress 场景)[28]:; r. Z0 I8 `$ F) B2 M
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token/ D) q; _2 @7 o1 u- P) ~; H
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
5 o5 D9 g# Z. }5 f! k. M同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
+ _8 ~* `/ {3 r/ c4 ?7 C3 R4 N" w! yLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
8 s) P p; m9 B4 v% }结论:
) E3 }2 i4 C9 f7 m; r高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
8 k7 a% v1 ?( F1 rToken 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。. [; o1 w0 k2 d {$ Q- T* E
二、建设期成本分布:区域对比
8 M6 i; J+ u4 Z% \; h以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。& Y. C2 ?8 B( }% u. ^' `; z" ^
: m8 Q4 ?- H) M; x2.1 全球/通用结构(以 1 MW 为单位), E) S$ G) T- d \
综合 JLL、ConstructElements 等[2][41][40]:9 \& x: t; a& ^) v- W7 v& E: ?
! g$ W* K% X4 i4 n4 Q0 n Q2 m
壳体+机电(Shell & Core); `& `0 f! @1 {0 y1 @
/ ?; e9 t8 a3 q8 X6 }9 ?8 z
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
3 u! T B8 I! H; e" p# Y5 v其中按成本构成[40]:
1 s6 R' w4 J( y B$ D6 k* P X电力系统(变电、配电、UPS、母线等):40–50%
1 l; T8 O% ^$ h* ~1 T机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%+ m; o3 i) s" f6 `
建筑与土地、结构:约 15–20%
- S! k& J6 b, m) i8 Z) B. _1 _其他(消防、安防、楼宇管理等):约 10–15%3 x L2 s, y0 R7 v9 ~
IT 内装与 AI 基础设施(不含芯片)
( Z( |) e/ A0 ~. R+ {( a- Y( y: B% ]" J7 X& ?/ c1 X, c; }
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
. p! Y3 j f7 ?* ^. LGPU/加速卡硬件 CAPEX
2 A' w: M3 u* m& F9 z, E1 h5 v! T7 c$ G0 U' n
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。6 b/ R( a, {1 t1 C0 {
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
~" `4 j/ F n4 K8 W- V0 ?, a. Y结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):& f5 n) o6 J, i8 @% X* f" {
8 L) g. D6 w: n) Q$ [区域 典型建设成本(壳体+机电,$M/MW) 备注" ?" G7 ?, O9 B$ F5 {
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]- p& ^; O# S. g8 S5 {# Q" r0 G
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
) B6 C' J: K. _8 G! p, z( y欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
1 S# d: Z+ }% j) k" A( j中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]* D" S2 A; ~7 ]6 X
结论:, s1 s/ \6 ~$ U3 J
3 l4 W$ F. | Z' d, S; F
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。) D/ S% E" }; ~
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
4 |, p% C/ ?- m" R- y3 u) }2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
1 C4 A2 r7 N, R8 R4 j, M9 F以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
, t6 A# W& p; y! a% Q
& l! |( V7 X8 ?/ D. Y0 J$ r假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;& j( x: i& h" P; T4 s, d/ r8 }
GPU 配置:
% h7 A/ X% A: `* N) h有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);+ X- R" r$ c3 ^7 T9 u$ d
每 rack 成本 ≈ $3.0–3.35M[34][69];6 [, ~7 [! r& \6 y! b% W. O4 u0 Y
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。, ^" `; A7 N; z1 |- K
与不同区域壳体+机电组合:
* S' ?5 N3 ]# ]5 e- `6 h( }+ N2 A# Q7 ~) }
以中值估算:
# ], Q- m. `& h4 x8 R- P3 J8 c+ ^6 H0 z. M7 b( z2 K3 L/ Y$ j
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
- P% T# r0 B5 y$ j/ d美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
3 P3 P9 g* `: H7 h( @% e欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
' s. h* q% S+ }( ~% p中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B& ?; q# }: c2 D! z- k; o4 y
可见:
+ [9 v; I/ T. q0 X7 w, k: Q
' C% a0 Z0 z2 K% d- ~% e6 QGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。0 F/ @$ [* s/ ?! T1 p
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
\9 [' w/ l4 z0 t7 x' G三、运营期成本结构与区域对比
* V2 n% H% t2 H4 t0 g( r$ }3.1 通用 OPEX 结构(高密 AI DC)
2 y& C3 B9 E. n$ t3 W# N结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
' g/ N" Z5 b) O4 N$ e
" l& n( g# E m电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。( Y8 t5 \7 }% {& Z0 W
冷却与水资源:
7 s& _4 s9 r5 j$ j8 I能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
* f8 i6 _4 `2 g/ E' K水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。+ @2 G+ l% g7 q$ v- D, h8 H9 Y
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
9 D- V3 P7 u7 ?# S& o" [托管/物业与维护:* T3 j" I, L1 \# P, _/ i
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
/ q. I! z$ }4 q0 G" ?硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
& h$ v% e; L' I; w5 ]3.2 区域差异(以 400MW / 3 年期为例), f# ?3 o) S, Y7 w
使用 ChinaTalk 的电费与人工估算[1]:
8 u4 f6 P. w% M+ t9 i% ]# p' T C$ Y0 y6 h8 t. Z
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
( @% \3 m! q! s. d中国:约 $0.06/kWh → 3 年电费 ≈ $350M
* ?' Q+ e9 D. s$ C$ [美国:约 $0.09/kWh → 3 年电费 ≈ $600M W6 J% g1 I/ e2 O+ V
中东:约 $0.07–0.10/kWh → $400–550M
, W* Y! l1 C6 z* T% V欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
- l4 d; y# ]) q( A水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:
& ^9 _; C( ~8 P, Y- Z2 n美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
0 o2 Q8 u/ @& b4 d; ^三年水费级别:- u! J9 t2 ^7 K. B9 s3 b! r
美国:$40k+; v( a2 c7 B2 J4 b
中国:$20k+
0 a5 ^( G" _6 Z5 h5 V7 q7 D5 F, J" o7 k结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
2 `0 J# `( o( R( _1 k人员成本(3 年) – 假设 500 名全职运维:2 \8 P P/ q# U; a, i
美国:500 × $120k × 3 = $180M++ z% \; C" V! Y8 U
中国:500 × $22k × 3 = $33M+' q- `' V" M+ `* X9 F( f
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。/ O5 v2 o; w: f) a6 W
整体 OPEX 粗算(3 年) – 400MW 场景下:, E+ W( E. c: b
! [2 w& o- f5 v+ I1 l, d. W A! x
项目 中国 美国0 D0 [: @. X; n2 X' c
电费 $350M $600M- V: d- {, W; S! p5 W3 i0 {2 J1 l# U
水费 <$0.05M <$0.05M
0 M: z4 l- Y! @- C! \2 y) Y人员 $33M $184M2 o2 `1 Z9 ]! \7 i- _) Y- t, o1 T- b
其他维护/托管 同比例估算,地区差异主要体现在人工与地价
' o8 K) N% ]6 d* _5 Z结论:
" x% A4 t6 ^2 e) @3 s/ v* E5 @; L) ~
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。% d5 D8 t4 d& S
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。* z9 z3 O. D. o" Z2 A. z
四、基于 token 的成本与利润推演 H2 G6 d$ P2 P+ _" b( f- ?
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
; i, z! _5 F: w0 f& |统一假设:
$ T8 i% [1 s: a0 t8 W
! P- S( j5 o; N( |6 Y1 V4 }典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
0 q0 u% Q) v4 x, S Z n* S1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
" R9 b3 e# U8 }, f3 @9 E1 百万 token:278 Wh = 0.278 kWh, G1 j1 p; ~; ` J
场景 A:美国电价 $0.30/kWh; h- T2 q# `, f. Z
电费/百万 token = 0.278 kWh × $0.30/kWh" H5 n8 B# a h% E8 f0 h7 i
≈ $0.0834 / 百万 token
( R+ q* \+ |' A9 q1 v场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh$ G7 q+ J" j9 \8 j t9 K- B
电费/百万 token = 0.278 kWh × $0.042
9 B, h! b. \; L+ a. V; G0 c" `≈ $0.0117 / 百万 token# K8 G" d! ]' K$ p W/ h
对比当前 API 价格(OpenAI 2026Q1)[62]
, |5 ^' ^0 S( d; v- X. G/ Z0 V) g以输出侧为主(成本最敏感):
. ?. a2 k0 a! V& n" Z' J& |* r1 z; Y" S0 p5 x
模型 输出价 ($/百万 token)" U s! R+ u4 S0 y! p4 ]5 @4 ^
GPT‑5.2 $14% t# {" M& A0 a5 }% ~2 D
GPT‑5.2 Pro $168; [( F8 L" g* ?& I
GPT‑4.1 $8$ ?$ N _! V3 T3 Z
GPT‑4o $10
7 X6 H! n: |* n* |GPT‑4o mini $0.60& e/ d! u, U5 x% p/ W
则:
$ B) e0 P8 Y) `6 L9 S' a$ R& K, n* U& u# Y" q1 u3 q3 ^8 s1 ]( u
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
0 i: z; b7 U( x9 m/ k9 C在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。# G0 _3 @" v5 ~# G4 v6 H( f
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
6 e/ {( g7 U$ e4 E" ^; z结论:6 B ^3 `/ T1 {: S" u# a* l
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
2 [# d2 A5 |9 Z( u4 J! T
9 z: i: X9 |$ o' |4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)7 w+ c( u1 E9 U' u2 `
以 LenovoPress 的 8×H100 Config A 为例[28]:
- t7 f( U+ u: N Q' e0 F
$ _, F* h6 y6 _5 年摊销下,8×H100 本地推理 70B 模型:
% k# K: [! p$ m. y4 S( ?小时综合成本(CapEx摊销+Opex):$12.08/h. q7 K% n' P5 Q {2 A6 U+ T
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens% V! O; {2 S2 y* ^
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
, r, \. b8 ~% N. u1 h- |' ^/ i电费在其中的占比:" ]6 I2 _. h, z: u3 J W8 U
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]
+ e' }" Z q4 C1 M9 C) ]( Y) a电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
6 \1 Q$ t: Y; P; K- Z/ }电费占 总 token 成本 ~7% 左右。
' _: y/ L, F; f' w/ k( M8 C若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。2 ?' G) W( o2 _
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。0 T0 |& k3 P$ d7 e4 ?6 q5 u5 Y
5 ~& ~1 \9 _5 Q) \4 a# O因此:
! B0 ^2 i. g O+ G* Q3 R& ~3 o0 g: O) U X, ]* T3 o" R A+ f
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
$ K) \; h8 G$ e, {& `/ o, T在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
) H z1 X7 d( x- Z, x- ]五、不同芯片方案的建设与运营成本对比3 q: K t/ \3 @$ I8 I4 u! _* V. ?
5.1 NVIDIA 方案(H100/H200/B200/GB200)
* u+ W1 ?" u% h( @CAPEX:- {# r8 w* `. O. O# P
3 J7 Y9 W |* `( I$ s! |H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
I9 \0 P7 F2 Z2 Y/ OH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。7 ], D4 O: {) I7 l
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。; q* T0 E. }8 Q8 O+ z7 s5 H% P
GB200 NVL72:
( Z. O7 A+ { \8 N h+ [2 \每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。6 t2 \. B/ F& a4 t# _# B
冷却系统每 rack 额外 $50–56k[35]。. f+ Y) D0 o7 n2 N* j
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。$ O, |6 n: ]$ N1 N
OPEX & 能效:
# K3 w& W0 S0 b" S4 \% |
2 s2 {. B! z; i4 u" m1 c) I+ P单 GPU 功耗:; F, i& I' U. C5 D/ A
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
) p. ?0 l# _) R% s' @4 wH200:功耗类似或稍高,但性能/W 提升[9][10]。
0 q# S2 Q4 d5 m' |2 xB200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
$ A7 O3 m& n% n* _: n' LToken 性能:9 B8 v' |+ J2 x' w1 [- ^
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。2 L k$ i3 |! f! o# d/ K: m
NVIDIA 的优势:
; C# M2 | ^3 V U8 f8 S6 N" N) f* z4 j7 |9 F) g1 B
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
" K! F+ ]% D* X, P+ m. N" o1 p. N但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
# D: p( m7 y& x7 v5.2 Google TPU 方案7 w4 w1 Z+ ]/ ]% A/ u& ?, r+ o* h
CAPEX:
$ h! Y2 r7 Y" i6 g e4 x- b) @
8 N/ ?6 z1 ~0 H9 ?单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
* \4 G; z# a" O( Q! qGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
3 S" V- W7 Q: r; n; ]8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
) h4 y: b" X: q% Y5 @, ?能效:3 J) S' W( n1 L) Y- U5 @- F% m7 V
( j- y1 O1 ~) n! Z* N8 o3 z7 {& A+ cTPU v5e vs H100:
: o K: X! N- r3 K2 ~' v" j同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。% n0 S. z$ @) H3 a' N
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。( ^! y' c: D3 G0 N! O h1 _' s
新一代 Trillium/TPU v7:/ w( O' ]# E- e9 A" g5 w. X! P
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。3 |* t) M X& y+ U5 q8 o l
Google 方案的特点:# U( R$ `) ~& J1 r. f
+ M+ S9 p! e( ]0 P' d5 R$ p# W( N
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;; o6 Z, S6 v5 r( ~4 G5 G
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。) e6 _( i3 q, r9 o
5.3 华为昇腾 910B / 910C 方案9 c7 I! u7 q x; q, y9 O( S% v
CAPEX:( c( s' P. |& A# h
; R3 O9 x# z/ L, j( y* `, S单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。5 L! ?7 R+ N f% j& G1 a
与 A100 对比:9 x0 N1 k8 d c* @. J+ Y
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。* I+ j- L: s F. W0 C
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
( R' f3 X1 |7 P$ J3 b: Y- T$ z使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
, O3 p7 N9 A! z0 z) BOPEX & 能效:8 G: Y) Q2 k5 O; M3 i6 |9 j
) A9 a- b. N- N% F8 A7 }* z1 `, U910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
7 A$ x& J: k0 O9 K% d* b; Q部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
5 `# T6 G7 @. W8 n: w在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
6 {$ K- `- p* V" U; ~5.4 平头哥真武 810E(PPU)方案# i G5 }0 q, A( I$ v4 S3 f+ ]6 K
CAPEX:# `# u) W, D0 T
3 T) ^) I2 R' X+ o% ]2 q技术参数:
: L( T" J6 F, c X0 n8 q96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
7 ^. l2 ]& n7 j( ^" r: `3 z5 u- X性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
* G0 d% o5 _* k% a+ V价格:0 y% ^6 w7 _' y) G( i* n
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。: {/ s1 ^, {# B, ]3 i
结合国内报道:# A4 f. g/ s4 B b
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。+ `% U/ _8 o- D8 B1 p
数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。+ a( O# `5 l3 J% X4 Y/ u( t
OPEX & 能效:6 @0 p4 J5 g2 E6 E. H4 d+ F( X7 N
. {% ~) ]) C1 B# d8 _$ @% |1 J
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;# g9 y/ b* k3 J I4 R8 z
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
/ L) b- I; j$ l3 t9 S( b) H6 N0 J六、综合比较与策略建议, R! V6 `$ `0 ~! @$ e
6.1 区域维度:在哪里建 AI 数据中心?
/ Z. F# }) m: [* ]纯经济性(TCO/tokens)排序(假设无政策/合规约束):/ J' v! I; H @( a" n" T+ M( Q8 k
' U) h e/ e9 H6 q+ l. Y2 e
中国西部/北部(电价低、人力低、建设成本低)
( D5 t% d; s. j) W+ L中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
/ }, D2 \# |' b2 t美国电价低但人工高;东海岸/加州电价上涨压力大! K- R# n' B" A* I) @8 T
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求# F: Q1 y+ Z2 F4 ]+ i
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
5 l: s( q, c' {) `7 o, N
3 ^. V; ^& U% v$ r8 Y, P纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;: z& \* E/ S3 C# A
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;) ]$ }% d' v4 s2 @; M0 C: [8 m" o: a
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
! m/ ^1 l$ \* N5 o+ ?0 e6 `2 c/ ]6.2 技术栈维度:选哪家芯片/云栈?
; k, m4 m" l1 g7 ^$ k若目标是全球最优 tokens/$ 且不受出口管制:
/ r4 v8 U: h4 d8 i' [( L8 ]/ i6 {7 E4 a
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。2 N1 n& O+ S" O/ g) H& r
若在美国/欧洲,能自由采购 NVIDIA:2 S7 q, j/ b/ R! I, p
, g3 B' Q9 G4 w
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
/ s7 k5 K0 ?0 J& V+ J成熟的软件栈与生态,极高的 tokens/s/GPU;
. N: t/ c7 @' S5 E/ F在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;# ] p. ^! O; J
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
/ L+ \) x* x7 S. M3 ^. s3 J若在中国或存在出口管制约束:8 A2 L0 w! ?8 S$ m1 w: A6 m1 M
# u( Q7 q3 G! f0 s
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
3 r# j" [* F9 W. j性能上已能覆盖大部分 GPT‑4 类推理需求;
, m! q. Y6 H) `单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
$ A- j# T2 L- n* }7 |& k) W软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
: L0 l0 i/ g& n( ]8 [: s) L建议配合:
- C$ m0 r) l5 l* r4 u+ Y9 c2 H高效液冷(PUE~1.1)、
$ y3 F6 @5 z3 y大 batch、路由(浅层任务走小模型/低成本芯片)、
; p+ e& \" I# g) v3 Y( |: G+ Z2 b强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
9 K! K0 m& O. v长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
. B H S- }$ V1 N: b, A5 M3 I* D
* F% [8 _( G9 d数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
0 Q; S9 o- V3 z* R. ]这意味着:
- D: F: C% j J8 I3 ?7 O) {优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
; N3 N/ f7 X" m- r精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。- a" f: C( B ^3 c9 q
6.3 针对你关心的具体问题的简要回答
; h) M+ w: a, R. _AI 数据中心建设 vs 运营成本的大体比例?0 v* S$ \/ {2 ^1 ~
) `" Q/ A; m1 |' O
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
$ E$ }" V1 J& d. U# p% {其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
+ f8 V& z3 P' o5 K* S; H中国、美国、欧洲、中东的成本结构区别?
, c5 S# F) n" A9 y% P2 W1 z+ M
- Z9 W9 j( y2 K% P* I建设期:. Q! q$ Q% i7 f( S, g) G t
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。: b9 j# j( D7 Q( n2 c, d/ u
运营期:
E: t5 l3 {' E3 ~电价:中东 ≈ 中国西部 < 美国平均 < 欧洲/ l3 r; S4 a) ^# i
人工:中 国 ≪ 美 欧,中东居中。 f! L, h" w. o9 _) `- U
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?8 P$ ~% m) a( b- o! L8 z1 A4 I2 `
+ D4 S/ L! I# p1 P" Y( e
对于典型 1 J/token 推理负载:) i i- O ^9 t) B/ @" I
美国 $0.30/kWh:电费约 $0.083/M token
# W- e9 N) B. b H5 N中国 0.3 元/kWh:电费约 $0.012/M token
- B+ D: e% m4 A9 K3 |* E2 b0 G3 c对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。+ s, t6 R B9 D6 M
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?9 P1 n, e0 N$ e, @1 S0 c
- K" m/ J2 M& o- B" o2 a2 _ b在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;6 P: c6 H5 }* [& a& A1 \
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;% p4 ~' Y# D* c& @: K9 F: |
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|