TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:; v3 b4 {0 |! }1 p
" K# @4 X! a! R* \9 I" @. c% y+ H
一、总体分析框架与核心结论
], h! T# _' K" s' ^, q9 D2 \/ e1.1 分析框架概览
/ g% n7 R' Z _0 V2 I# _拆分维度; j- O+ S+ p% g5 P' M! ` \
m( D3 A: W. W& K4 a
阶段:" }3 [6 O7 R/ `7 ]1 W% T: u# I) A# ?9 d
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
9 l8 @$ U( I2 v* r4 r运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
: J5 I2 [3 J3 y9 k区域:
9 I6 Y( a7 L/ P( j: P) X" K中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
/ R. q1 b4 T# |技术方案:% o }3 t7 `3 D+ M B7 \6 N: Q; i
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
) \$ |. U. y* h: q( U0 TGoogle TPU(v5e/v5p/Trillium 等)
# Y k$ b K- `中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
+ n$ w, p7 f+ k2 l算例基准
# v, _! m% y( i6 c% ^4 }
5 I- ^7 Q ?' u以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:2 b2 t. g+ {3 _ e/ X! Q
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
, i: U) l9 o8 UPUE 假设约 1.11(高效液冷场景)[1][29]- E) P/ h" i0 U- ~) q
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
& B+ v! [$ f& @3 O' @+ v关键指标4 z: h- O2 e, Z* h0 a
! d3 G! E* M1 d/ C) ?$ V$/MW 建设成本(含/不含 IT 硬件)$ I9 P h. z/ y6 L
$/kWh 电力成本、L/kWh 水耗" s- D3 B9 a* I3 f) y ]0 V; ]
$/token 或 $/百万 token 的综合成本$ \ R$ T4 r! H7 H
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]6 Q2 X0 M& D4 {' S( @: ]4 A
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
/ `5 Q( v% p) V, \1.2 高层结论(供决策快速参考)- _! I& O7 g( d2 o
建设成本:AI 数据中心相对传统云数据中心成本翻倍# d! R$ m, W2 e+ ^4 h
7 E- [, U5 I" G" o' r/ ?% x
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
: ]9 g8 }$ m3 [& k& Y+ W) b* xAI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。" j8 L, x5 m& K* z
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
5 t' H, _/ E. A2 s区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
" k6 S, B6 J/ l6 _
( n& G+ d; J7 f: k+ L4 {6 |% I+ V中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
& }/ F, _' R/ l! Y0 q* b美国:$8–12M/MW,400 MW 约 $4.0B[1]
* ^% d0 }, ?# T! p# I8 [# x欧洲:接近全球平均 $10.7–11.3M/MW[2][41]9 {6 I0 ?4 {# s- P' s
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
% W8 A1 n5 X) Y- @结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
0 ^- w! R, @8 Z% b) d+ k3 pOPEX:电价与人工决定区域优势
" h; B% a1 D" W
9 U* i1 {* i/ ^) w, \, Q电价(2025–2026 工商业大致区间):2 j, r$ p6 j9 A( E, ^( z" O- M
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]* Q( M1 t: W3 d( L/ {
美国:工业用电约 $0.085–0.09/kWh[44]
) b s* T9 ^9 R1 X欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
7 a, x# M7 a4 [: A' |+ B中东/UAE:工业用户 $0.07–0.13/kWh[47]
6 X' V) m% B5 w$ ~: C! f人工:
# T( s9 `) }+ f) {- f中国数据中心运维:约 $22k/人/年
0 h% [. H" e$ L; p" E5 m4 n美国数据中心运维:约 $120k/人/年[1]# \: T$ z6 h; ?1 X$ r& C. y4 { m/ I
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
$ E' H7 J a* [3 y; a9 R能耗与每 token 能源成本:能效差异远大于电价差异, B9 S. |0 A7 @# Y: V) P
& ~5 u0 M( m2 h& q7 HIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。3 b: t6 q! x! m q/ k
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
5 N9 Q: T: u# F8 W将 token 能耗约化为统一口径:$ E, w+ ?" D$ t! e
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
' p, n0 W/ ` L" S中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
1 T5 r5 |6 q4 j美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token: S/ Z. n v* O. J( m5 d( h- W- a' R
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
% s, f$ w6 E9 z) o& F# q不同芯片方案的核心差异4 I0 o3 I b, \5 |7 ~
7 k1 |* ?/ L/ b) V3 }
NVIDIA Blackwell/B200 & GB200 NVL72:
% v1 b6 R I/ ?) ~$ g m单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。) X& w1 z9 N% B2 G% X' N
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
$ ]* t% k' K: cGoogle TPU v5e/v5p/Trillium:
" t* P% X( y+ }TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。; @9 p* R, q2 P" s
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
" N0 k, b; z5 @" V3 Q0 N; ~6 F M华为昇腾 910B:
- _# y0 k& J# Q; n4 bFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。/ u4 F; F0 E2 j, X
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。( o3 W1 ?) A2 b' V( [
阿里平头哥真武 810E(Zhenwu PPU):8 F5 O% U0 p" f$ Y9 o6 H. }& H8 X9 Q
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。, C5 p2 v3 N; `: q& ]2 j! u
结论:
2 v6 C5 \$ Q3 t0 R能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
' |# M4 F- o- F/ z- i& Q单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。: U' H4 p& [, b. s; \5 S0 r, n) S
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
1 r# v/ ^- v; F, J7 r& d2 n自建 vs 云租的 TCO 与 token 成本
5 Q& [8 N; o& F' a/ R% R
, Y8 D& U! S2 a7 h0 rLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
$ J- W, q/ k8 {; U# C8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
( c+ u( g7 N6 O6 D等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。, u4 A5 g8 t8 |8 J. m6 I
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
. B: c5 X- u/ _5 nToken 成本对比示例(LenovoPress 场景)[28]:
( P+ \1 m5 U0 p5 q2 a) O2 }" VLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
( v/ Y% n( S5 r) qvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
S; Z U# L" H) r5 y' d5 H同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
& r2 B: J6 A" e; h. c' _Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
* G( t; _0 ^/ u5 u结论:! \' D+ F" `) G C
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。9 T0 b7 H% n; ^# s1 z! v+ w
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。( Y* f8 E1 ]6 e9 g; D
二、建设期成本分布:区域对比4 K+ V5 J& _" L% Z: m& V4 q* t2 v7 I
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。; m/ w. t0 [$ `+ v( }# Y5 i
. Y/ h f3 j* ?" g( q' N8 j2.1 全球/通用结构(以 1 MW 为单位)
9 s3 [; W) M/ r: S6 R综合 JLL、ConstructElements 等[2][41][40]:; H, X( r% i' m) u3 [6 {
" r. y+ @8 H1 h* h
壳体+机电(Shell & Core)1 f3 m6 K, X C; Z2 i
- N/ V% a, F8 \/ l
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]# u2 w0 v8 P+ o( K J
其中按成本构成[40]:
% u4 d7 h( B8 r3 ^+ w" K! F电力系统(变电、配电、UPS、母线等):40–50%
$ n" R% R) |$ D, A机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%8 j3 Z% {( k$ F1 V
建筑与土地、结构:约 15–20%
% j+ h! X$ B! _$ t( T* K+ ]其他(消防、安防、楼宇管理等):约 10–15%
+ G; {% x" o2 K4 `( v/ c) kIT 内装与 AI 基础设施(不含芯片)
; \$ x8 ~' | \
- a1 t6 u/ ~8 B7 e1 _8 G高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。$ H) q# ]4 N: n4 u3 w0 `
GPU/加速卡硬件 CAPEX F3 U3 `# [; S8 O- g8 K9 v
) O% b \+ ], r: ]多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
5 v$ T( \/ E0 n/ |9 N# i2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX* x6 x4 y! N& R+ N1 F3 s' x& X8 P
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):7 W( j U, u4 A6 F! |
/ ^- i6 D$ J* v. d+ Y v7 W
区域 典型建设成本(壳体+机电,$M/MW) 备注- y! L- _ a$ R0 \) ]; i5 n0 b
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]/ s/ j" j: z+ k% B& m' Z
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
$ [! ?8 N( `" ~1 a, O5 d欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
5 n; _9 q) @4 R2 m$ P: m中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
, \. p8 a" ~0 {) e, e% p( A I3 m( }结论: w9 F" w/ J% ^: j
4 {) w) m9 b) V( T3 i/ [
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
) D& [: Q1 T! q2 O若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
1 h' a! T2 q: [2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)7 B$ o D5 [: j. M2 C- B2 o0 B
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
6 i* m7 Y- }7 Y3 ^" ^* k5 y/ L! {. p; V( v6 E
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
/ p; f9 m) k8 O+ Q* E0 [GPU 配置:8 K! u! n2 x i: J% u+ q
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
1 }! @7 U' U0 _. q每 rack 成本 ≈ $3.0–3.35M[34][69];
' R5 H( \0 k& S7 ^* ^3 j$ YGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
+ v' C/ d, j: n% C6 m与不同区域壳体+机电组合:; D# u* v6 e. {
7 }* l% w' [/ N: c
以中值估算:
9 s9 A* F- z* l' J3 E$ o0 o- s p: d# w# C. S
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
- |9 ^9 Z4 m9 X- u$ _美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
+ X, h8 B1 ?2 P# X8 v欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
4 f* G+ v( \4 M& t) W* ~/ z# z中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B/ h# |8 L- ~8 l s
可见:& W* v7 R9 v7 H. }8 s9 @
$ B8 c0 M' ]: B0 A' h% hGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。. w/ A! c9 m6 _
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。1 J, \& V, i* y+ d4 S8 ]
三、运营期成本结构与区域对比
# J0 w$ ^0 W9 R" ?" t3.1 通用 OPEX 结构(高密 AI DC)! a! P: t0 L+ ]' v# @
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:3 B, f) Q; {9 ~- U
2 K" s g- Z+ ~
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。# Q7 {$ h. S6 O0 b; ^
冷却与水资源:
- p, {1 ~ p) k) V) o能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。! ?/ K( |3 G" A n6 V
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
3 \- R6 p6 J" w3 C9 A. G5 t. {人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
1 h* i a7 [8 ` o' w5 B托管/物业与维护:
8 ^; r* @; s& K- R5 b托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];- M# @5 O7 t8 V! h" {' `. E6 f
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。! G2 G' J# k+ N0 }# R! ?
3.2 区域差异(以 400MW / 3 年期为例)
& Y" x6 L, v" Q/ m* C# X1 V使用 ChinaTalk 的电费与人工估算[1]:3 T3 ~+ K; `7 F3 M, U$ q
K2 _" j3 m# B! e9 F电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
# L3 D2 q9 p* R9 B1 x3 S中国:约 $0.06/kWh → 3 年电费 ≈ $350M7 p$ @% M; @1 y2 z# b
美国:约 $0.09/kWh → 3 年电费 ≈ $600M
6 _0 Q& N9 D) F" Z- W中东:约 $0.07–0.10/kWh → $400–550M. r8 E4 ]& ^! a6 S" B6 ^) c H# ?, A
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势) S. L3 I& x" w; F6 z
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:
' T) Z5 a2 g) c美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]/ N) {* x1 U: {
三年水费级别:
8 Z s2 q1 z$ m- ?6 n美国:$40k+) k+ O" o' M5 g( O# L) H7 ^7 J
中国:$20k+6 y% F5 r+ ]7 J: |+ `* y: _
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。+ @6 [0 l* u- b; q3 u6 ]
人员成本(3 年) – 假设 500 名全职运维:7 k4 y& B8 ^- a/ T& V4 ?
美国:500 × $120k × 3 = $180M+
: D1 o l* v, A5 r& ^: Z中国:500 × $22k × 3 = $33M+5 P0 U1 z/ c9 y; `
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
* A+ D, h$ F' M3 i2 u( V& ~, J整体 OPEX 粗算(3 年) – 400MW 场景下:
- o( b2 U; d/ u& c. e
3 T/ D7 z3 q4 q, r* `1 Z4 \ k项目 中国 美国
# Z1 |7 u; U7 }9 Y/ X8 v电费 $350M $600M
8 `) h0 m5 l% g' y4 y! D水费 <$0.05M <$0.05M* _6 J3 M$ Y9 H( j( Q
人员 $33M $184M
: {8 Q0 f _" \, u* k Z其他维护/托管 同比例估算,地区差异主要体现在人工与地价 9 m5 c4 V" N/ Q# j
结论:, A6 @. x* g5 z
: U# @; u" H- j x就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。5 o# e+ T3 q3 j. d' f" `! N
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。1 ?7 U" t& W7 y2 R- b; q+ r" ?
四、基于 token 的成本与利润推演
, d# N5 g3 K% U4 U* H' t4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)- k, N( C5 B" Z: S6 n% ]" f
统一假设:
1 c& g! s$ d/ H4 I, G& [6 v, k" \
: ?" R' \7 e0 A& w典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])7 W- R& a" ]" N) A8 V
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh1 N, T' \' y" M" u4 Q" h0 v( _
1 百万 token:278 Wh = 0.278 kWh
! s9 U, l/ A8 Q! K" b8 S3 n场景 A:美国电价 $0.30/kWh
+ \- g: X( \8 |- H% Q Z电费/百万 token = 0.278 kWh × $0.30/kWh$ l# B1 Q2 \. g
≈ $0.0834 / 百万 token
+ R# e" Z# j2 s# F( a$ q场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh% ]4 w5 R) V' K) v' Z+ _3 w' ?8 m
电费/百万 token = 0.278 kWh × $0.042
; n! {$ `6 G5 O≈ $0.0117 / 百万 token9 k% W9 l/ G3 M
对比当前 API 价格(OpenAI 2026Q1)[62]
3 ]+ f6 h% x+ ~# c) V以输出侧为主(成本最敏感):
0 p) J9 ^: V" ^' c' L! x6 v+ g6 n# t& E+ e
模型 输出价 ($/百万 token)1 S5 ? d G" R% @! ^4 X
GPT‑5.2 $145 C) X- I! s0 x9 F3 U
GPT‑5.2 Pro $168( }; d5 W! f0 ?0 v' { B
GPT‑4.1 $8
3 b' v1 ]- B+ xGPT‑4o $10
. Q! f+ p. K1 ~GPT‑4o mini $0.60+ ]& c3 L+ Q! `* b: l; R
则:
! R; r9 P- ~/ }3 _# U- y
3 Q3 A4 s( V* l @7 x在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
3 ^2 W5 O* L+ l5 Z( L, P在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
9 P8 ?! r& ^- l# C8 Q3 {# M# I& W相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
`7 v' _# b% U$ N( V+ U% Y结论:
" W/ ^4 z5 W, y, g! W6 X& `6 }即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
! m0 {8 m* S$ g# K) ]) G
6 m6 ?6 e, x# l# k4 n4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)0 |6 W9 J& T. @
以 LenovoPress 的 8×H100 Config A 为例[28]:& q, M; n" b5 }
/ F% ~/ C2 t w" y5 年摊销下,8×H100 本地推理 70B 模型:8 D4 L8 S, O6 W" o6 Z* U
小时综合成本(CapEx摊销+Opex):$12.08/h
O: Q2 D7 z4 b* _7 V吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens
. I8 Q( I( X: B- _成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
3 {9 Q7 u5 v7 X- j% k% r电费在其中的占比:
# U8 Y% q' E0 }! Q5 i9 R& NOpex 6.37$/h 中电力+冷却约 $0.87/h[28]% k4 c) h' s. v$ v9 F; j
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
9 p0 r! `" u$ i3 |电费占 总 token 成本 ~7% 左右。5 C, i$ s6 l$ Q0 M! z" `" W6 I- P8 r
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
- s9 ?3 L8 ]3 |8 U# k* a% o* B0 t; N; r若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。
: V, Q4 v9 l/ l+ d8 e6 i* Y2 L. X0 R1 }" A% y# }
因此:
/ ~7 e F, H1 y/ C
& j* H4 A' p2 y. L5 e) `在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。3 _2 ^( B: f/ k7 ~; ~
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。$ D8 l- h' V4 n+ U* f) n" }" d
五、不同芯片方案的建设与运营成本对比9 V& J( t; T9 h: q
5.1 NVIDIA 方案(H100/H200/B200/GB200)
- f+ ^2 ]2 c( i+ Z6 x3 X& K; qCAPEX:7 F6 l* a6 E3 x6 T( o
P. X( v+ E7 r3 l, T0 RH100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。; U1 k( C4 e& {: [- q
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
& Z7 d9 D. k7 r/ {7 }B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
y. B: A! l5 ` y [5 Y- pGB200 NVL72:
* e5 n8 e9 P8 z W6 B# ?每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。( H( @' e& r" ]$ l' L5 o
冷却系统每 rack 额外 $50–56k[35]。
, ?# h0 ]3 c5 U! m在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。! v9 V' A6 r6 F/ Y# T3 u
OPEX & 能效:
" ]6 [$ ]6 L% {
- |7 ?% X$ Z8 l, T: H单 GPU 功耗:
7 H' C9 y! l' T6 @- |H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。$ f1 G9 k6 U- G; s; x4 L$ h
H200:功耗类似或稍高,但性能/W 提升[9][10]。
' b9 S4 J7 T) gB200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
' B4 i/ `7 Z! q$ V. mToken 性能:3 W4 l( y; E) t! m- X
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
- G; k3 R- @7 s3 r/ ~0 jNVIDIA 的优势:
7 O1 j, U) e2 V) C1 ~
) ~% [/ ] y0 B3 z' p软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
# ?5 C+ G0 u8 O( S# ~但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
$ e3 y# @! D1 E5.2 Google TPU 方案, S% u1 k/ i& G9 }' B" n
CAPEX:; E# M# U, |1 F0 z
6 V! @. h- O6 f) }2 S! q单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。' _6 L8 V0 p$ o' P; d* e
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。9 F* N L* W, b/ b/ O8 R0 D
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。" P4 E/ b5 U; p
能效:) y* V/ n& M5 v" Q' R9 {
) E/ j+ e( H0 q* i1 N
TPU v5e vs H100:% l3 l+ f7 P' D
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。9 b" D' `/ ?5 M, } u% e+ R
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
, |$ h2 c4 ^# H, x, K新一代 Trillium/TPU v7:
9 ?+ X/ L5 z- z1 ?. b3 s能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。8 v- Z: x2 r# `9 `
Google 方案的特点:1 @4 N: V# K* }* r9 Z# x7 q
2 v9 m) I1 P$ {, L
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
( C% [( I: i. l/ d3 G" B对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。4 u$ h9 o3 J; p
5.3 华为昇腾 910B / 910C 方案2 y+ E. i0 {7 |$ h
CAPEX:6 i* A: `+ z. H; B( g& i( b( M" ~* Q
# N! p, n- j, m ]单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
9 O, F# F" J% z+ @与 A100 对比:1 k2 J9 O+ Z9 u
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
! O6 b* m* z& T& p+ q7 t3 q市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
" `$ }# O0 P) X. F9 m使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
# X2 H4 R2 f1 L- zOPEX & 能效:$ _. E q! e+ n- k9 ~% ?" }
& \ z. I8 g5 d910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
. w4 F/ G \$ z1 c& u1 S部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
6 ~' f2 ]; i& L+ v% |1 W. _' d在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。" X9 J6 E) |/ A9 z( u
5.4 平头哥真武 810E(PPU)方案 t( ? [( k8 d& n
CAPEX:2 ]: j$ S' O- ~ k% c( O8 i
+ `1 ?& V6 o( b% O& w2 a技术参数:
$ r4 t4 g: o' X$ i96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。- E1 f4 n8 Z$ n2 @
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
0 B) n, `+ b% x8 O- q价格:
/ x2 S F$ W1 b未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。7 }% ^& L* s" r. b+ ^0 p. e
结合国内报道:6 O5 z: e, C; _% z+ b) `1 Y7 u5 _
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。1 _; U) x2 |+ L7 e! w
数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
M3 j. c6 i7 L+ `2 bOPEX & 能效:
" l* n3 o# d8 ?, v$ [
; O( S. v9 u* q% K6 Z400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
% m9 p7 k8 v2 F; _3 r1 Z在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
4 c. Y k- e! U" z F! I六、综合比较与策略建议 K3 |% C% a2 U: h
6.1 区域维度:在哪里建 AI 数据中心?, C7 s) b u& W9 i" k8 @" f+ J/ E
纯经济性(TCO/tokens)排序(假设无政策/合规约束):
9 M2 u7 @1 C6 i1 W& e6 m/ ^+ j& y# |5 ` S
中国西部/北部(电价低、人力低、建设成本低), R4 k% I. `" f; G' h; u
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
" v; F& R( S/ W美国电价低但人工高;东海岸/加州电价上涨压力大9 E5 ]4 | w4 D: _3 E. e
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求2 }" Z* R V- r! w) d
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
3 t" |; u4 L. N3 h; W( N7 ]# [) E- e! j3 @( \4 X) a1 f
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
9 X# ]4 |9 k7 }对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;2 u# {' q9 R6 m! X
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
0 T+ F, X5 j6 y6 Y/ j- G6.2 技术栈维度:选哪家芯片/云栈?
' B! q* Z9 H! `& f3 P9 a: q0 ~若目标是全球最优 tokens/$ 且不受出口管制:* M2 J. _& r8 P) ?0 g
5 P! X, i' n( v) z. N- zGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
6 B& S# K! ~6 O1 u+ @4 a0 h l5 m若在美国/欧洲,能自由采购 NVIDIA:* `1 F. J U7 J# a% \, f1 `% t
1 |0 k* I. F! |短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
* ?. M% g# U$ _+ m& q2 V; o5 f- x% h成熟的软件栈与生态,极高的 tokens/s/GPU;0 ?# `- m) i4 U" N5 [, ?5 X
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;9 V9 g; I0 u. m7 P1 ?( i2 v) Y
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
1 q/ ] o4 d, S. M9 ]若在中国或存在出口管制约束:
% e" Y3 a% b: Y/ k# C" J0 K# d6 O$ E) e9 _6 @! ~, M& `8 M3 B5 w y6 D
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:) [& q' `% K3 E; ]
性能上已能覆盖大部分 GPT‑4 类推理需求;- b6 ^0 e* n" F7 A) g; d
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
% o n% {7 [4 N软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;! Z. _% z6 |. x' u$ o3 z) W+ X( ^
建议配合:
1 y+ n, q0 |* @5 x8 m: R高效液冷(PUE~1.1)、# @1 I8 r) f0 ]+ A
大 batch、路由(浅层任务走小模型/低成本芯片)、, C( w# ^) B9 s+ j) @6 [
强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
$ S4 r0 c, b1 [长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
' Y; q' U( G& f7 c* e
0 V1 j8 L1 w2 @数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
; G5 r5 }) O7 f: b这意味着:
+ c+ h* o8 u, Y- }# Q- E优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
6 H3 v7 x9 M% H m5 |3 z" N: @精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。, j) f7 i0 d, j
6.3 针对你关心的具体问题的简要回答( w& B' N) h& [) c2 M, ?0 @( K
AI 数据中心建设 vs 运营成本的大体比例?
, S' E6 I; s8 V7 R4 r6 h2 d' q* _# E* m
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
# O1 |" q- L! W; ~+ }- i# ]5 R+ H* @其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。/ z, R5 b% |9 c" F1 H
中国、美国、欧洲、中东的成本结构区别?
5 o, x* b: F# g' {' G8 ?# C3 H+ r0 S$ M
建设期:& X8 x% {1 _8 a" |
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。" z6 b! H, [0 p" B
运营期:3 y: P1 Y O+ e
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
+ ]7 j* Z1 W5 z, m人工:中 国 ≪ 美 欧,中东居中。; y7 c1 v& p. ^8 r
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?# F- R T+ b( U7 z/ x1 x
' d$ J- C1 |+ C( w# E8 N' N$ _! Q6 y
对于典型 1 J/token 推理负载:8 a* b7 \, y; f4 m( R
美国 $0.30/kWh:电费约 $0.083/M token1 M4 ?8 z1 ?* R# t( H5 [
中国 0.3 元/kWh:电费约 $0.012/M token$ g1 y. j+ q i' b9 R
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
V; N! `0 G/ V2 a3 P o% |' |不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
6 R* W$ q) l% r+ ?: C
% v) \9 \0 Y3 m4 f! Z$ Z0 X在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;9 p% q( j6 O. T: D' u6 r$ I, Z
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
. m J3 f9 }& L- d5 ^) n中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|