TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
' j+ w/ L! S5 i- i% u" o7 ^" t3 \! Y; A) L! b5 W+ w( K6 Z
一、总体分析框架与核心结论
* v/ R U; M F @# f' ]0 {1.1 分析框架概览
$ e" [1 Q. g- M0 E4 T拆分维度. Q0 r8 w% ?$ H& z; K3 g
6 Q: v5 Z- t& S! g
阶段:
3 O4 R/ D& Y7 O8 @建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
9 Q; Q% q- }) Y" |7 [运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等4 h' p1 [% k) U+ [6 A( C
区域:* ^5 ]4 ]$ U9 q6 {% [
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)# R9 w& ^6 }5 M0 ~8 N5 f
技术方案:
8 t! _. t* e' n. eNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
- x' I- S) T8 eGoogle TPU(v5e/v5p/Trillium 等)
* O- H% c. E2 I. n中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
% S6 g; Y4 @; J! Y算例基准
& o# h3 m- Z' O; h6 `
! b4 j1 u+ A- z2 U l以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:( s+ E* q$ h- ~& j& r( }& |
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW( I0 C- @; e5 R, V6 \# P. p
PUE 假设约 1.11(高效液冷场景)[1][29]& n& D" t$ C' ^6 c/ W0 ~2 Y
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]+ U* o. m7 U! V$ w$ [3 b* z
关键指标
9 }- `; W- f7 u: f/ \, Y
; b7 Q/ E; T& A% U$/MW 建设成本(含/不含 IT 硬件)
" c; b: V& d: @7 D) {7 a$/kWh 电力成本、L/kWh 水耗6 U, h3 [8 X: n
$/token 或 $/百万 token 的综合成本
; P" R% W' J8 R) _Token-per-watt / Joule-per-token 作为能效基准[17][18][26]: F, L% l8 j- s% S7 n" t: z* k) p$ D
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
2 o; N7 y/ s8 m' I1.2 高层结论(供决策快速参考)' @! m- Y" p7 K5 g, Z6 Q! ?! n. s
建设成本:AI 数据中心相对传统云数据中心成本翻倍- V M% o, A: n! F
Y6 {% u, d- q2 k- Y4 a
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
' `; Y: J. e0 L( ~AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
, o5 @1 F- o r8 m0 {按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。8 \& @8 L- L/ e, _. g6 L
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区9 i* j4 m) z. |( L
* j6 q$ J. a$ G" b( Z) l中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]- ~+ b" s3 _/ {! Z' I4 e( O! H
美国:$8–12M/MW,400 MW 约 $4.0B[1]
9 a- |3 Z+ M6 f: p2 T8 T: @" U: @欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
& m, G8 u4 e( E' z中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]. v4 o' `3 S* L% Y
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。! x" `) T N+ f+ n
OPEX:电价与人工决定区域优势2 E' t+ f8 F$ r3 N1 H- I5 t
2 ^8 ^, U# Z" ~* Q. A! K
电价(2025–2026 工商业大致区间):
7 V: V- L3 l, x) X; v中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]( I9 ^0 ~5 ^7 |* b- |8 ]$ \, X$ u
美国:工业用电约 $0.085–0.09/kWh[44]2 V+ t# s- Z6 w& U+ r' [- O" C
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
; t, J( [+ H( P中东/UAE:工业用户 $0.07–0.13/kWh[47]4 N% L. g* l3 s! A; p: g
人工:
8 i8 O: ]5 ~0 }( C中国数据中心运维:约 $22k/人/年
& |* k" q7 s* s- Y美国数据中心运维:约 $120k/人/年[1]
, ?$ J. e/ M8 z4 ~: z q结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
8 h7 m( P2 E3 f' R! t& m5 D7 L能耗与每 token 能源成本:能效差异远大于电价差异
% ]! w4 f. R8 `+ C6 E3 ?
8 W+ m' S) X" t& x* ]6 s8 K$ x& nIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。) o( B, x b5 e1 N/ M$ U5 l
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
% Z* B( Y# K: Q: ` @8 c+ l将 token 能耗约化为统一口径:) m: @+ X# u- Y$ B! X
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:( p" A: O, T: H* h( Y7 Z( K; e$ w
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token) Q9 ?- G& V+ m! b" w
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token' Q% J* I4 v% _& `+ k& }8 q- a5 b
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
* D) x5 s; b+ z: C/ t# h不同芯片方案的核心差异# |2 u- X% K) {: K8 L- a
- k& t) l0 b+ i/ TNVIDIA Blackwell/B200 & GB200 NVL72:7 ?. T$ k) g- W" I a; A9 s' \
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
; F3 \% y! \3 m' _& q' l8 P: hGB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
1 X0 t# H4 G) ^; Q1 H$ B. sGoogle TPU v5e/v5p/Trillium:
7 c: J0 H# m) X0 FTPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
6 W* C! d. Q; T( c! MGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。9 C# i6 X8 a% J# l
华为昇腾 910B: M; ?9 h1 w6 Q+ a6 @. D9 i
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
, Q y6 E2 D$ {! Y. g" f单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。, H6 v; D# O) {) |
阿里平头哥真武 810E(Zhenwu PPU):; N) m/ I. \# f3 f
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
0 Z$ H. T$ I( f3 i结论:$ i6 H4 s% m+ |9 l; Q2 x9 h" i- J
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。8 J/ c8 ^6 E" Z, L5 I9 y' O
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。1 B$ [+ o5 A7 v7 s4 N( D5 d
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
, K: c' Y8 x' Z" d自建 vs 云租的 TCO 与 token 成本
7 Y0 t, F S* F0 c& ]/ R8 Q" {5 \6 j
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
1 o0 F! W; y+ |& @8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
2 M. R$ s/ H, c4 S0 ~! Y等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。. X0 g! N8 X5 z4 K7 p
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。/ V& A8 w: X' S( j3 L
Token 成本对比示例(LenovoPress 场景)[28]:
7 F+ [7 {8 |1 dLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token) {2 H- K" {3 r
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
! @" `9 s5 I) f/ V同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。3 b9 A" i) a' G/ B; [; G
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。( \1 I4 @5 n% P- g" C
结论:
( _1 I2 x, x- p) x t' R+ v: [高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。1 H6 ?0 B# q- b- K( i
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
) L2 W& j! z( y$ f二、建设期成本分布:区域对比
! ^0 M: E- G' i8 ]8 \/ N2 k以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
6 x$ U S# D" ~0 B2 R8 c
, p" I% B$ N; X0 @, T I' g' D# v: Y2.1 全球/通用结构(以 1 MW 为单位)# g+ U: x! u ?# ?1 g7 U
综合 JLL、ConstructElements 等[2][41][40]:
2 W. b& E# ]% c/ ?& j
4 t4 _& ]4 t8 \/ S/ y壳体+机电(Shell & Core)
% K: G% n0 h2 ~
, ?3 c8 @* t+ ?# Z. \/ b/ D- N全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
2 N5 b; `( W8 {' X% o其中按成本构成[40]:
2 b* k& _1 P+ s X" |! P3 H5 k2 Y电力系统(变电、配电、UPS、母线等):40–50%0 l! _; L1 p- X- s9 L; j
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
2 Z# l$ d8 h0 Z/ S2 Q! w. g建筑与土地、结构:约 15–20%
I+ x: F4 }/ f5 F* [其他(消防、安防、楼宇管理等):约 10–15%
3 B$ G+ v3 i% w1 ]7 ~IT 内装与 AI 基础设施(不含芯片)
/ v& `% @6 k( L" a( J; R) r
3 x. N9 h/ l( G( g+ X3 T高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。( {2 @" w1 X, U ]5 y
GPU/加速卡硬件 CAPEX! r1 p5 I) B/ o, u8 Y B3 J- s! S
" }& b, ?* |0 d8 _$ g
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
6 F. [/ t, c1 E9 H: _* `( ]" s/ f2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX3 |* ?7 |: Y0 @6 r
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):
4 C: K5 M) }0 ~- J, G" F4 f6 ]2 q8 o, y8 z" i
区域 典型建设成本(壳体+机电,$M/MW) 备注
/ c, S4 d6 A: Y4 E8 \+ X/ E( k6 q5 i中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]( y" O, y% y" g4 J, D3 d7 ?
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]9 p& s5 A0 Q+ g8 n& u/ W
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
* S5 F6 `- L6 J2 c' S' V+ k中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]. l1 |5 h; {( k/ ~6 |
结论:: U. A' K5 ?$ B& t
0 Q4 x1 b; h. i8 v
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。3 N& M! d) _! s; \0 B" B& X! M( m8 Z
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
* T8 C; B. G; I2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
2 @4 }# t0 j }: X% r以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:7 X( a+ Q4 @" S" ^. Q, j
; F2 w9 a9 u# L' L8 {/ o, ^
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;: n8 b- s& `1 Y# i- g
GPU 配置:- u. y7 J* ^8 t$ e( C9 o' g7 \+ p) E
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
. Z- ~; P' o; q j每 rack 成本 ≈ $3.0–3.35M[34][69];
" e1 M2 C8 u% R/ r+ oGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
% J' j e& d4 X8 i与不同区域壳体+机电组合: j9 X; F* L$ e$ e2 y- {8 u
* r R4 E: P/ r; A以中值估算:
9 Z" `% q. P2 w6 s; x5 z* T
( o( m) c$ C0 Y, M" ^7 e8 C* T中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
: f5 L( [% K5 p. P# {5 ^2 u. ^$ z& c美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B5 x# [8 G& d2 i. t0 F% C) y( s
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
; n. f/ K% ]1 w4 V' K5 _ ?8 o中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
' T. o" {0 U' w! x$ W# |% N6 n可见:
- [3 _ `" `/ x. \* B0 ]7 e, @, L$ P2 U& Z* l
GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
Z& [, V5 N# a0 V相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。3 C2 O2 a/ y! w8 c' y. r$ i0 B
三、运营期成本结构与区域对比
& k! r z: a, e4 q3.1 通用 OPEX 结构(高密 AI DC)- u2 q: T0 t" N0 x0 S
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
3 f3 q3 c! V2 ~4 R- k+ d/ D. {3 X7 ]7 T" d' w4 E2 \; v
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。4 A, i( W. i: z* K6 }* z& p% n
冷却与水资源:
; O! h7 @1 V. v, n; A9 L能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。; [/ a! C) X/ N4 k1 M
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。2 @8 V L. ?/ p/ q3 K8 }5 J
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。% k! F7 H0 K' W5 Z$ k+ J8 y6 E
托管/物业与维护:
( W4 X- m" o* P5 m1 G) Y' a6 a: h+ ?0 N, H托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
- h- I, @7 g: \/ B硬件维护:LenovoPress 模型中按设备价 12%/年[28]。8 J6 e8 h2 e; ~. v
3.2 区域差异(以 400MW / 3 年期为例). r4 h+ f: G% z# N' `
使用 ChinaTalk 的电费与人工估算[1]:9 G) I4 v$ {9 O; z4 k; c0 z6 D7 q* _
/ w" v$ L- G8 I. F
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:. h3 |( n" ?7 i5 i4 A* d9 O
中国:约 $0.06/kWh → 3 年电费 ≈ $350M
, `% }- D% t6 v& {美国:约 $0.09/kWh → 3 年电费 ≈ $600M
* ~/ p* z4 s. s; Y2 Z! B! e7 W中东:约 $0.07–0.10/kWh → $400–550M
& A, ]- o y) C' D* S- F欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
( Q- P, W# q! p: P. H! A水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:3 U: ` V! K* Q- [. L: x: Z
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]. M; v% Y. [$ {% O2 ^# d$ l
三年水费级别:
8 z! \. [& Z& S% O7 s8 h3 x美国:$40k+2 [( D3 C) B: L* Q; A1 u. e
中国:$20k+2 W; l# U" F0 ]
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
% f1 D, v5 n0 Z/ G人员成本(3 年) – 假设 500 名全职运维:+ P% m- d r( i0 J3 R
美国:500 × $120k × 3 = $180M+
. q% C) R" I# [" [ }2 W中国:500 × $22k × 3 = $33M+$ m; W. r% N* k# L
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。* ~8 q( t7 V* f/ S* D' N
整体 OPEX 粗算(3 年) – 400MW 场景下:- c! e. z9 p8 A4 F4 M1 r
@: D4 N4 Q( m
项目 中国 美国
% x. p. C/ a+ d) |' v4 m电费 $350M $600M
* z5 V6 e* n9 j; S: i: D水费 <$0.05M <$0.05M- e3 w9 s" H2 J5 G0 J& b
人员 $33M $184M" T) \# S! ]9 h2 n L- P
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 ) p! g2 ?( N7 a4 n' E8 k
结论:3 C. T* W$ Q( q* l
7 x5 K9 g" ?! Q0 P就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。1 ^2 G3 o* b% u' Q
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
9 z: Y* h: f3 b- M) I9 d0 N. w四、基于 token 的成本与利润推演" e0 n5 h* \, g* d/ H6 \6 s
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
3 @3 x- c- h. \5 V2 ~统一假设:. ^% ^+ V( Q1 |7 J; i1 z- Z `& A
8 p3 T( V$ U q0 w% x4 i
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
. v8 \5 n- `* M4 p. u! X8 t8 a1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
, d# j J# _! D* ?9 ?( ]1 百万 token:278 Wh = 0.278 kWh
+ Q/ e9 h! V d# H r; U4 n场景 A:美国电价 $0.30/kWh
2 M- J7 ^* k( f1 \- r5 J& K9 O9 d电费/百万 token = 0.278 kWh × $0.30/kWh
! ^4 q, L; X: M≈ $0.0834 / 百万 token
+ w7 B, l3 ?2 n% M场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh) L5 R- h) }# O. g
电费/百万 token = 0.278 kWh × $0.042
; D. F: E9 B. y8 Q% e" K% e$ L≈ $0.0117 / 百万 token4 m! m! @9 E$ H2 k7 _0 Y+ ]/ c+ { Y+ n
对比当前 API 价格(OpenAI 2026Q1)[62]0 V# r! S; v0 Q) K- e& a, c2 s
以输出侧为主(成本最敏感):: B M7 D1 a- w7 E; W w) R. E
2 s3 r! S( _; r9 F7 \% C% n
模型 输出价 ($/百万 token)
7 c# L! t: ~2 H: a& }1 h) L( i; \GPT‑5.2 $14% r' k5 u7 J% I$ b
GPT‑5.2 Pro $168# Y1 n' X5 X0 u" k& |
GPT‑4.1 $80 f* c$ |0 z! `& \) L) {, \
GPT‑4o $108 I, g) h3 ?. b6 o$ @, q7 n
GPT‑4o mini $0.60' e* t: t4 e3 f/ r' I' Y
则:
9 r/ E5 L# C3 G& R2 ~
- R/ {# b2 A7 b. ~3 x* T( t在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。& A: P. @& V1 P" |
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。4 F' X; @2 q1 k! Y
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。 ~( w0 G. a5 P' |4 m& h8 ~
结论:* P/ S+ }- Z, F& e5 |$ V
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
3 u5 g5 T5 X/ z- P1 P! M& B H/ H2 `) k$ O4 [% H* r
4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
( ?) U4 S/ E# @/ H- _6 U; V6 P9 e/ t5 F以 LenovoPress 的 8×H100 Config A 为例[28]:
9 _' Z6 h: |2 N0 l5 g2 @2 E& C% E5 n7 c- {; b: N5 q
5 年摊销下,8×H100 本地推理 70B 模型:1 D! V5 P6 T1 P6 a
小时综合成本(CapEx摊销+Opex):$12.08/h, m4 x1 ~- t1 T" X6 Q
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens
+ Z2 k3 P+ {( ?: r/ I成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token2 H: e: U' B2 I3 _* {: m
电费在其中的占比:* e& a2 u1 _8 F: t: t. q! L* N9 \
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]( z$ n; q4 W. o# L @8 j+ }+ Z
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token9 A$ v0 D" y0 C" }5 z- w
电费占 总 token 成本 ~7% 左右。, D& q' H& ]; h$ R5 y; \
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
' q; n1 D6 v" w! Y若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。; m% V( V' x+ T; b/ I1 u5 b2 ~
4 l" d5 X( T; l' m1 D
因此:3 W0 v1 s) p: H
* e# }, J8 A0 Q) i在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
3 a7 T& S: F0 p在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
. A3 [2 u2 z u五、不同芯片方案的建设与运营成本对比& N9 W3 b& l8 d( Q
5.1 NVIDIA 方案(H100/H200/B200/GB200)5 B1 I/ { b. P# S& u5 `: d& H1 l( n
CAPEX:
* K0 ]2 { W N! |: e4 z% U( i- M# E- I
# {' M$ W; U. H1 N# K% L; ^H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。3 P* h' j3 Y% k* D4 H1 s
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。, v% J! z. h4 m" p5 v
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
, S$ d4 r1 z$ T" {) vGB200 NVL72:
! r8 q4 R3 s; n" ?8 T' o$ S, Q每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
! ^0 y N% [9 C$ \冷却系统每 rack 额外 $50–56k[35]。. L0 R& {- ~: k/ y+ p5 f* z/ V
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
% m+ V. @1 u5 Y P2 BOPEX & 能效:/ z1 K9 d3 {/ C
4 k% Z: P2 B1 r* A; q单 GPU 功耗:9 t# J( D0 C5 |4 G. ^0 y/ t
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。; ]0 I. Z+ C8 g( W! @% d
H200:功耗类似或稍高,但性能/W 提升[9][10]。
# E% K" V. l( B2 N _$ s) U( NB200:标称 1,000W TDP,但实测约 600W 左右[68][69]。' g$ \* o, k% A- \, o- L
Token 性能:6 ~, ^: Q5 K) p; \8 q
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
3 |. n4 j4 K3 Y8 Z5 @* F+ _NVIDIA 的优势:' Z" ~0 V( ?8 H3 a7 H# B5 L" {
- m4 `0 _1 N( o$ a
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。) v9 m$ O! {. d+ X% B7 Y' ~
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。3 }1 S: n5 c! j1 y1 T9 ?4 a
5.2 Google TPU 方案
$ ^+ ^: S, \2 l* b/ J. _+ @$ {CAPEX:
* Y$ A9 G" \( O+ ^9 Y. @$ i: W; P$ r# i: ~ X$ [$ t/ X' d
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
, p& ~4 j7 d3 k( j" wGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。: I9 s: U9 Q& d/ L3 Q7 D$ U
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
) k' c0 `, C4 ~, k' n* r5 a- l能效:) k/ F) f3 z6 v; f
& u/ U% \: l" _: P; [/ H; {TPU v5e vs H100:
' r3 j; c' E; _6 s I) g同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
& p9 \" F2 h& L测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。 w" i2 j- T; h' _
新一代 Trillium/TPU v7:9 b' J0 D3 ~% W2 N' ~8 t4 P7 n
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
, F2 b* b. V' L! B. M* Y/ PGoogle 方案的特点:
% z) o0 @6 d; Z5 \; I' h+ J/ ?: [; G. {" g
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;* m+ w1 U9 ]0 q N$ Q& }) J6 y$ u
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
* A$ b/ ^/ ^; m- r0 w0 T5.3 华为昇腾 910B / 910C 方案+ d5 K4 r8 e, _+ `8 a
CAPEX:
/ n# z! a( A; Q1 h
; K' @9 c3 f I1 h单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。" r$ z( E) N3 Y- D P
与 A100 对比:
. k- ]7 z$ \; }FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
/ K/ u& P6 e. M市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
: ^/ s* O V- ?: f8 H使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。4 f ?. `# x5 P1 P# W7 N
OPEX & 能效:; @5 W' y! `+ L4 | p
/ y, E% Z7 W' }$ N. ]6 N5 u( {910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。/ D% i7 ]/ H7 v( n
部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。3 r" A" a7 Z( c; K
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。+ u2 S# G/ J/ j+ b( U$ Q. G
5.4 平头哥真武 810E(PPU)方案- m) S2 x4 E% G3 e
CAPEX:$ S; V4 B O# s7 u( P5 Q' b
( `+ i2 e" A; w/ ?技术参数:7 a9 W. r) k- N! B, \: ]# p, g
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。% Y9 H8 t& X9 a" M( E
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
5 E, d6 J0 V7 ^ L价格:
9 R9 L4 \3 ]- N. [未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
! `% i8 [( E0 N- B: d$ w# L结合国内报道:+ x8 J9 X- S! D1 T$ a5 s1 T; p
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
4 r* N4 C* n9 e; o R数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。7 o4 F# f& s! e: V; p
OPEX & 能效:
5 T. _9 n' y0 T1 c1 @' Z
2 n+ i! y* U. z8 d7 L400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
5 Q9 n9 E7 N3 l, x( b( N/ { ~ {在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。3 u8 p' b% @1 ` A8 e% y7 T
六、综合比较与策略建议2 n" o7 k' O# q: r9 Z6 p
6.1 区域维度:在哪里建 AI 数据中心?
# w* a3 v6 t+ P/ o) X- t' w纯经济性(TCO/tokens)排序(假设无政策/合规约束):$ z/ ` P7 n# x4 t. `
8 ^8 G# p6 d$ j+ o/ c
中国西部/北部(电价低、人力低、建设成本低)
8 e0 R( c. \2 x! t: f& R: O中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
3 ^" p5 ]/ x2 T' f美国电价低但人工高;东海岸/加州电价上涨压力大
( `1 H, _: A2 ^& G) M3 J5 {3 A, M欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求+ L( W; S& ]4 a
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
% E8 ~0 o9 {4 ~
: s6 {0 C8 ?2 S- a纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;- I X+ u, l: x( \2 Y: K
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
; E7 w0 |, ~" W; e) _5 n但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
/ E# f$ U- |' c2 S3 w" V; r1 J6.2 技术栈维度:选哪家芯片/云栈?
6 v9 k2 G# ^# O9 ?) J9 p若目标是全球最优 tokens/$ 且不受出口管制:5 k5 l' j8 I9 m* h+ h% p
: X) {1 Z1 q. c; ^* _8 oGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
$ ]: \( p; w$ h& Z; r- ~若在美国/欧洲,能自由采购 NVIDIA:
. z0 ~1 X6 h4 l- s9 ~( a& W4 d& U3 i$ p5 M! f* B% s O
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
8 x1 [4 b* A; L# n& k5 D! R- a成熟的软件栈与生态,极高的 tokens/s/GPU;) W1 @$ w9 q3 `3 f5 L+ K8 {0 m
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
) U0 ~: j6 H. T) |! r! {但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
# g6 }" g& C( t) V3 O4 i若在中国或存在出口管制约束:6 u) t( d* j* \; _* z u
' ~5 Y" T V3 }$ x" Q昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
- x n5 ^8 j4 d* l3 w性能上已能覆盖大部分 GPT‑4 类推理需求;0 l5 i+ |# n, K+ T0 R8 v9 @0 m$ b
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;3 {% v7 C* x* d+ b# v
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
, O+ s, \0 D' I* c( T+ k建议配合:
0 f& K$ X6 E- o( z6 e5 g$ P, T高效液冷(PUE~1.1)、
( L/ G Z+ K6 L* s7 O) Q/ d# W大 batch、路由(浅层任务走小模型/低成本芯片)、
/ N7 }/ l% I5 c强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
0 |. U0 k; o4 J! ]3 Q长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
" E, E) l) N; @1 ?6 m5 N
+ u7 F1 u, H' q. [, B, H数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];! z7 x) P- }# v* O- x0 Z _
这意味着:9 J" _+ P& Y. [8 N' b
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
; S8 d) ^# Z0 b2 `. |8 Y& w8 P精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
% ]8 X) t% q2 t9 q, t* L6.3 针对你关心的具体问题的简要回答: S: [ x) c0 F. r) T8 ~1 W7 Q2 _
AI 数据中心建设 vs 运营成本的大体比例?, O$ f- x9 _+ J9 X
6 b5 o* F; \5 S& J/ f# I9 @# D) m
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。) K O( e, C1 D$ p
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。! O0 }3 [6 j" |) W9 U
中国、美国、欧洲、中东的成本结构区别?
" o; J( @8 z! U* q0 \( s& Z; [+ m% Y/ h7 A) Y. [' M" Q0 z7 j
建设期:
1 e" v" W5 T6 {( F6 s中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。- w: P2 h# S+ U1 f% R7 k+ S- l+ z
运营期:5 B5 z; I% o) j! n; i
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
$ z+ L# u% ~4 N; @* k人工:中 国 ≪ 美 欧,中东居中。" ^; S! X1 b$ u& I- R' `. z4 R
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
8 v0 u, [9 H7 m" [" h `7 `; P; W h0 m# D% C8 f- X
对于典型 1 J/token 推理负载:, G( I, n7 B8 x3 @
美国 $0.30/kWh:电费约 $0.083/M token
1 E9 I8 k2 S( x6 a中国 0.3 元/kWh:电费约 $0.012/M token: U0 \) O' V- E8 S* M, _% Z+ J
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
) I4 K6 [/ |* ^, q- T# m9 I2 o不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?4 ^ w! X, q5 b
% }( q- h: g! g. K$ ^, a
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;
/ e3 \# k' [! j% [$ `全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;3 y3 S7 _1 P z' G1 ]0 H# T9 N
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|