TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
/ T3 ?5 a, W7 g5 X) c8 l' q% U; d$ X X K9 V
一、总体分析框架与核心结论
, G# c& n. v- e f6 R: O1.1 分析框架概览
9 ~3 @' L+ G' [1 R K- e" c, z拆分维度
! X3 s. q" I' R) W# o0 ^5 @- t8 c/ {) o9 i2 F. V1 l
阶段:
8 \3 i4 d/ D/ x7 u9 E: |建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施; D: K0 X. [& Q N3 ?
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等! R- A# X2 y6 c0 W+ W: o0 Q
区域:0 s; G% |- w2 g8 o" u( ~, U
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
: F5 [3 }' R- k技术方案: E2 t* S" E. ?% l; \& B. [
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)0 `1 _/ `' j0 ?( M; C
Google TPU(v5e/v5p/Trillium 等)
; m# b$ b+ `1 S0 W8 s中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)0 k5 F( Z- `! p+ _& h' ?% }
算例基准; ]! I u% O! u$ T" H" h$ G
; u& Y% ~. K M( x- P; Z; }' k以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:" m$ g0 R( }$ D, p* {5 o! I1 j- }/ e
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
6 {# n7 [1 H$ r4 z2 p& H- LPUE 假设约 1.11(高效液冷场景)[1][29]
4 t7 `$ k' h; r时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]# @1 u! t, {' \! ^0 f" T8 v
关键指标$ \: Y6 @' E( n9 x: H [
7 c, G0 ^- Q9 e) C0 f# U# U$/MW 建设成本(含/不含 IT 硬件)3 r2 I8 E8 K! m7 c
$/kWh 电力成本、L/kWh 水耗* L8 p0 N: X# J; a, ?3 {
$/token 或 $/百万 token 的综合成本( T7 i( [3 m. T8 ]
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]
) T% s7 p# c2 v0 i8 N5 `项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租); t+ o, A& L2 c6 R) J( r2 ]' W
1.2 高层结论(供决策快速参考): i# a. F, T" A5 a9 e
建设成本:AI 数据中心相对传统云数据中心成本翻倍' w2 q/ u, \. D- @& N j" [
& b" S% h( N$ T, |: Z传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
! _7 J( b1 a8 x8 U/ |- q4 UAI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
0 O1 E! f* o; _$ w$ R按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
- V3 V' ~3 c5 ]% _0 {区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
# S* M/ [7 k# g& e& i+ f, g, s+ l& d1 X ?/ T
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]- F2 x& I4 X0 k% {/ g- D& W! Q
美国:$8–12M/MW,400 MW 约 $4.0B[1]/ j* \' s' w% c5 m( r% g+ g
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
! W1 g9 X" Y1 j8 H% e中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
: o1 @; {$ g; [ @6 N" U结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
, D) n8 X! ]# ]' M5 u" [+ {OPEX:电价与人工决定区域优势
2 H3 |$ u7 N/ Y* e8 i0 k
" P# G9 Q) z4 S" ~' g; [电价(2025–2026 工商业大致区间):
3 K7 p/ T2 U; W中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]# p! f( f2 d7 N ~1 F# J# ]
美国:工业用电约 $0.085–0.09/kWh[44]' `( ?/ b r& I- r
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
; b$ V ~' ~; n* m/ P, {中东/UAE:工业用户 $0.07–0.13/kWh[47]
2 ?4 y& r6 ?& |! c% p. d: N: O- i人工:
# n# `' y# K& ~7 V+ Z8 i3 ]中国数据中心运维:约 $22k/人/年
% h. a; O1 h9 e$ V美国数据中心运维:约 $120k/人/年[1]( F+ ~! Y! T- A$ K9 p) m; t
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
8 v. R5 v3 ^. |4 v能耗与每 token 能源成本:能效差异远大于电价差异
. s i% K' f5 `0 R2 K! S n7 Z& Z3 @* T8 P$ l5 O& G: y0 W, X1 u
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。2 E. @2 O; x5 g7 b& G6 {
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。% i# M! J$ F3 O" i
将 token 能耗约化为统一口径:0 V D0 J z4 y4 V/ O) e8 C
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
3 d8 R% {! k! |: m中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
0 @/ S- e2 q7 K2 j) v" {美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
& _% y* o& o- f对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
+ o" S8 [8 @" e2 u不同芯片方案的核心差异
9 [1 v1 V: {2 ^) s' W/ a
" }; O: N1 r% V, kNVIDIA Blackwell/B200 & GB200 NVL72:
" D8 t1 f' g/ \1 I0 u. S7 N1 J单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。$ s/ Q8 V; D U1 N9 L
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
: b; m# Y; Z5 ~: H" p8 Z+ R% \7 [Google TPU v5e/v5p/Trillium:
/ W n L# t5 x9 y; FTPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。& i, T8 j' s) f+ o
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
& w/ p( O) e5 O9 f: R华为昇腾 910B:
) D$ I* S' D5 D$ c/ A' `* ]FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
" T6 ^4 H5 Y' c6 Y9 d( K单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
+ J" e- e8 J7 Y1 R阿里平头哥真武 810E(Zhenwu PPU):
) i5 U3 i3 B+ [; s96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
4 x+ @5 e& T" A; {结论:
( y f: Y }: Q( w! s$ g能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
/ x3 r7 p+ ]' \1 q5 x1 d单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。1 @ H- u4 K% q7 P) E
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。6 f" B% M) h' m' G
自建 vs 云租的 TCO 与 token 成本+ K5 X" ^6 @3 _" z. `
% I0 c9 l! w7 }$ D# R) J
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:8 ?2 K1 B/ Z9 g$ W. J5 a: v
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
M g" T" `; |! z& Q6 G( e等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。1 A! a: x" K& O3 R
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。0 Q1 @9 L% L& y0 ]& T3 ]& O' r
Token 成本对比示例(LenovoPress 场景)[28]:
/ c% y M4 i* i2 d. E. hLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
+ F& n5 I2 ?" I1 j% jvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。! Z0 e" _# n' P$ }" h, Q4 c
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
, { ?, D" U8 cLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
! J8 f) x7 c" ~* N7 M结论:& q+ h7 b& I) V) t: f
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
; i( Z" x0 s' e( o( WToken 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
# v2 w2 z. B7 Q! U二、建设期成本分布:区域对比
& h2 T3 {$ W r Z9 `$ r以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。. |. }2 F0 {0 P; T. L+ ~
# k( D- y; Y0 u& ?
2.1 全球/通用结构(以 1 MW 为单位)) y- R, c2 @. b1 Y) W0 G
综合 JLL、ConstructElements 等[2][41][40]:
. w1 A* C$ ?" L8 D9 V9 | ^, L' q! \2 ^( n4 S: A/ h7 F5 A
壳体+机电(Shell & Core)
, Z8 v) k& W5 z$ W' _! o0 s# V; c3 @% r
. j5 U% V, W8 `# k' b+ |全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41], u8 i& q# \& }, K& x6 O7 u1 Y
其中按成本构成[40]:: t% z( _' j, e U1 A' [9 x K
电力系统(变电、配电、UPS、母线等):40–50%/ J8 G+ G3 u+ _2 K' t8 B& P
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
* e* V/ }. g8 G0 w, r建筑与土地、结构:约 15–20%
4 h9 b3 n: J) |; k- `1 b7 J其他(消防、安防、楼宇管理等):约 10–15%
6 i% Q7 d) \: a q) HIT 内装与 AI 基础设施(不含芯片)8 q+ b3 z: E+ A) K4 f' i* {; W
! a: E: \1 O0 Q; f高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
2 G: F& e$ q p% A, u: ^" hGPU/加速卡硬件 CAPEX0 R+ Z0 S- d- E: Z9 d* L
9 w$ D' E: P% v. R. _多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。8 f4 G6 W" A6 H/ |0 R" j
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
/ A7 m4 ~! S' c3 B# i, v结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):5 C% J" I0 ?5 M# B
9 `% \' w+ n( A( C. b7 j区域 典型建设成本(壳体+机电,$M/MW) 备注
N/ K: H' n0 J/ `2 Z中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
/ b* u9 V- @9 c5 ?: z8 t美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]* I; M2 { c( {; w Z( Y9 @3 j$ i0 ~
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
R, {& j2 O" Z: h; o; }9 z中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
3 t. S. b: d/ f# Y结论:
4 M: L. H& \: K
; J! W. A L8 V: a1 i单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
+ v. ~, Q' d# N3 \若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
; |9 d( i$ L) J' ]7 f" B( f2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)% z8 b# X% ~* t6 {% n( r6 F
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
" I/ N- L- ?0 o. P6 I h, e! G& L5 c- H: H4 c* K4 N/ t
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;) ^( J% f7 G5 k; J2 x8 r1 q* @% M6 q
GPU 配置:6 n5 M! Z8 j8 A& B* X! Q
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
7 e! R4 {9 T7 F A# H; [每 rack 成本 ≈ $3.0–3.35M[34][69];- A; B: R/ o% K7 y
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
6 u! h3 K0 D2 Q% p; G3 b5 l与不同区域壳体+机电组合:) f8 m/ P0 K+ A! W
! }+ \0 Z7 O0 @1 ^0 Z
以中值估算:" h( E9 O6 ?0 s6 \
1 }! l$ O5 j0 i% O p, R$ m# N0 M
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B; O: t n, d1 c, E6 ]4 R) m R
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B: Y D; B$ U' ^6 o% `" W
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
3 p: ?2 ?1 D2 J4 V3 U中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B( M) t A, a/ P
可见:
7 X+ L. \+ B% i1 [3 Y
4 K% y* s8 T& Y# [6 N; P) v& u$ Y' ^GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。8 g X; X4 |6 r7 p3 u. c& K
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
# c% r6 K$ `+ r6 F9 K3 K三、运营期成本结构与区域对比
6 M9 j" k9 A s/ A A3.1 通用 OPEX 结构(高密 AI DC)
`2 k5 p+ p/ m/ ]结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:1 k1 O; i" a0 j) `+ }3 S, n+ d
) g) o' r- Y0 M: }/ l6 p5 t电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。' I. V+ q4 @, x; W' W0 [/ i7 l& D
冷却与水资源:" ^, Y" A: E/ B, q) I0 B
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
# n8 b) B/ |* J; C水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。, y$ N& k! ]' K6 ?' S
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
& \+ }! I" ]% d3 O1 M) [托管/物业与维护:
4 D( Y5 ~4 X; H/ d1 L' E) C9 K* S托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];4 v7 t& A' r2 x5 b/ }
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
- V# U2 _$ ?: g W* u% L/ N/ k3.2 区域差异(以 400MW / 3 年期为例)
r. S% S" b# T' K% y) z使用 ChinaTalk 的电费与人工估算[1]:
, ]$ g, N1 ~* X$ V3 f
! C, a/ z+ `; c6 o: \2 n! D电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
# |0 }) z1 {6 K% U' e2 @) n# y- [+ q中国:约 $0.06/kWh → 3 年电费 ≈ $350M
; |2 u9 ^. v n( ^+ w; D- r G0 p美国:约 $0.09/kWh → 3 年电费 ≈ $600M
- ~' _6 H2 h* o6 ~" |; S: ]; i& B. p中东:约 $0.07–0.10/kWh → $400–550M
5 v2 @3 |0 i- F( y" |欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
! r& f p8 u7 G水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:+ A' ~# [' D$ a
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]- @3 }: ?6 o: I
三年水费级别:
`2 C6 Z' w% w% L: a$ _ z美国:$40k+) P: X! H: l* r# S/ z4 }# I
中国:$20k+7 z' U1 f$ @1 G
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。$ L) F& l8 A3 {3 g* m5 ^
人员成本(3 年) – 假设 500 名全职运维:1 U- x8 q# N) C/ b6 w
美国:500 × $120k × 3 = $180M+
% V1 C4 a/ W+ ^8 E7 j) n9 }* I1 `中国:500 × $22k × 3 = $33M+
9 H' U( L; N9 y: p/ g) ]- S差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
4 F. N, t( P/ w' P9 y9 W整体 OPEX 粗算(3 年) – 400MW 场景下:) E; H* }6 e- ?4 l. e
, c9 H' [2 p6 M/ v _' @; X项目 中国 美国7 m. X9 F f8 `0 ?$ i3 O- |
电费 $350M $600M
, y9 j5 [; z* Q3 d6 V2 g5 Q! O水费 <$0.05M <$0.05M
/ w5 i; D/ u6 @) m+ w人员 $33M $184M, p& ~% ~0 Q8 e- K. l& }6 z2 k
其他维护/托管 同比例估算,地区差异主要体现在人工与地价
9 g" a, f0 T( d* z) @) K4 b8 j结论:
- I" f) \' {0 B g
4 P, k* G2 J7 b1 p8 w- W3 L就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。: w! J1 w% N5 @" e1 Q
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。# ~. B5 Z. \, ]' [) _3 u
四、基于 token 的成本与利润推演 u. K4 T1 r% p- T$ a6 O. K3 y4 c
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
6 `" w" a9 C1 B6 a* D" S3 q统一假设:2 @5 ]2 B; r1 t0 T
: Z) s, n% w5 z* `) k典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18]) `# o. O3 ~. L
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
6 a+ D% b: ^% I. o& \7 O6 V1 百万 token:278 Wh = 0.278 kWh
6 Q& B: |* ^1 M4 F& u; l场景 A:美国电价 $0.30/kWh
6 H7 }9 Q, {1 ~电费/百万 token = 0.278 kWh × $0.30/kWh
! M @/ n: m$ R1 p: m; N8 Z O$ N≈ $0.0834 / 百万 token2 l+ g. H: |% L' V: l. t; G
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
! D3 f# ~4 V% A& c; L0 z7 T W电费/百万 token = 0.278 kWh × $0.042+ M( q$ p8 v. t- R2 |+ d' f
≈ $0.0117 / 百万 token
4 t/ r) Q r: R( z5 T; n- m对比当前 API 价格(OpenAI 2026Q1)[62]# k0 S R# t. Y, m- c& u+ Y
以输出侧为主(成本最敏感):3 L2 ^' e( z* |( [$ Q' q Y
q3 A. \6 V- d& X模型 输出价 ($/百万 token)
. [/ j- [3 c5 ]5 \% x7 lGPT‑5.2 $14
/ c- z8 t6 p5 {; F( L5 V' x5 pGPT‑5.2 Pro $168- C n. `( V) [
GPT‑4.1 $8
2 U" { U" _4 w) P0 r( V( sGPT‑4o $10
7 c6 I, C3 J$ y+ _6 AGPT‑4o mini $0.609 l/ O+ M3 M( m" Z% V$ J7 n
则:
. {9 P4 m* R, K* j
5 v: D7 ? k' ^/ g; t, ]- r. k3 u在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
; }( s' z. p% Y% T. c( ^2 ]- Z+ h在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
9 k4 [) \4 L! O$ ^3 i# ^, y$ Y相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
# C0 e6 F9 N) }% L" G# r3 Z结论:
' P9 C; I* w: L: t! X' ~0 v即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
4 p" j3 y( a; K) h# J9 P/ V3 R6 Q1 V# |/ t2 m4 J
4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
/ [/ \) c: {$ R0 X7 _9 ~* L9 _以 LenovoPress 的 8×H100 Config A 为例[28]:$ {) Y( Y$ S2 }$ L5 y3 f. y, P
- b& r; v6 J p7 l" {5 年摊销下,8×H100 本地推理 70B 模型:
1 t. h) a* R( P/ G; c! c% j小时综合成本(CapEx摊销+Opex):$12.08/h9 @$ v: s% ]5 S" R2 B. W
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens0 T8 i( K1 g- C( r ]
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token) @" P9 z& K I
电费在其中的占比:# d4 ^ b; K/ i
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]
! y) w5 \! i! @; A+ z: F电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token9 F1 a; l# n8 G# U
电费占 总 token 成本 ~7% 左右。 \3 h3 [% o C
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。% v9 ]! Y- b. C6 ?! i& d( K0 t
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。1 z$ U& E7 Y- A, g/ i2 z
; i# X y; O3 O$ A因此:
! f& L7 x! V" o; p" d4 v$ v9 l+ t" {* }+ y' m( @! K; L6 k
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
2 r% @ p9 ]8 d# j% t# j在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
, E5 `8 c- S. ?, _# \* h, P五、不同芯片方案的建设与运营成本对比
& d1 N9 e' z8 e9 K5.1 NVIDIA 方案(H100/H200/B200/GB200)3 T, V+ q1 w/ |8 Q/ D" O' J0 V4 L
CAPEX:/ c2 M+ Y8 @0 k/ R7 J3 m
/ S! C* q8 u- \. t; U0 q
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。! g5 ]3 n7 T) h8 W: g- Y5 Q- O; T9 ^( M
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
$ N+ p+ Y; n% ~B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
- s& B L/ O* W, F$ D* Y4 |GB200 NVL72:2 m* u, K: @: S- O( j7 c! [
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。; Z/ H( q: g+ @# [) P
冷却系统每 rack 额外 $50–56k[35]。# E" A' B: g" G, R# U* t9 F
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。1 l- b/ y1 u% O/ u0 h: |
OPEX & 能效:8 \* ~4 ^1 m5 W3 B2 t' S2 I# ]3 Z
% ]1 B" ?9 H$ j/ C
单 GPU 功耗:$ {1 G- B5 I" M+ d' ?, d' ~6 ]
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。3 s; \+ s m/ y( A, K1 U
H200:功耗类似或稍高,但性能/W 提升[9][10]。
: r+ e8 i. I3 l/ aB200:标称 1,000W TDP,但实测约 600W 左右[68][69]。5 i; q, \. a) x% k
Token 性能:& ^& x& F% W: a0 J% y9 [, y1 r/ z
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。, n& S, l/ l0 }: b) s* A
NVIDIA 的优势:) ?8 ~$ k3 g2 t
) b+ P# G* a4 q5 C9 v# `
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。* s+ D, e2 Z3 o1 E
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。/ N. Y, g# G9 t9 x1 y2 X0 o
5.2 Google TPU 方案
+ H+ T) F8 Z3 @& D9 nCAPEX:
$ ]) u( B% Y& T4 `3 B
* h! `# W! ~5 G; d单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
% G! v, B6 @/ m3 w0 T- E0 @GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
/ {5 g* O& D2 G1 v6 W8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。; `- i2 l$ z4 q$ }' v/ [
能效:
! b. s8 S) V! r4 F0 W( }3 i: e2 [% r& k+ F4 W, _1 a
TPU v5e vs H100:+ z& u z4 O) h9 b4 o9 g7 C' i
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
) `* Q! j2 j& K" V. r测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。, N3 u. b7 s& x# s8 t" Q; K# e
新一代 Trillium/TPU v7:
1 j" G1 f2 F V$ U( H能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
9 h( ^1 v6 X* N' _; _Google 方案的特点:6 }2 L" K1 h$ G0 R+ {2 @) B
; l4 E& o7 I7 u自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;- G9 @) f, V; F1 \+ h! G! S' I. K* L
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
# r5 U: ]0 I4 z# U* e) j# [( C5.3 华为昇腾 910B / 910C 方案
# K. L" M# T/ P/ @2 UCAPEX:
0 W, |9 A* }, f: }7 v! n0 V A2 n8 E8 D. v: m9 z$ @
单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。3 {" a( p' Z- q2 J
与 A100 对比:$ o: d# a3 J% T& ~
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。& T7 E. g7 [/ U$ \% l$ }: M
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。+ X, o* e9 F( I3 N8 {- b" f
使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。6 O% S3 o, A/ R5 J& B
OPEX & 能效:0 o, g1 j) x E. c$ |$ y& `2 _
/ G' y! _0 z* J1 B# ?$ Y5 S+ ?, d
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
9 S- W9 ~6 j( |9 Z$ ?部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。7 d7 C# W# h8 d* M( X: U# m
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。* z0 ]0 T% x+ P) g7 c
5.4 平头哥真武 810E(PPU)方案
8 i) @. e8 Y6 mCAPEX:
- y7 U" P/ K0 m$ J: K
% o' V8 ^6 B/ K3 y- n技术参数:- m( ?4 b# ~7 h- f# n
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
) M) P* s$ z) l, ~$ _7 P) P" Y- {性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
" d. r$ \/ }6 {0 [) ]/ T7 D价格:
- e. [! ], Z! w: M未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
* v$ n( e% K5 H5 I6 m3 R结合国内报道:
' f3 s P1 D2 Q( \4 {& X0 y0 m3 O. @2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
/ X$ Y9 ~6 Z G数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。- q/ d+ K5 b/ E7 I4 u2 N/ U# w
OPEX & 能效:! \# X* ^3 s# e( v! }: e3 n$ A, G
7 p3 N# y; P2 N( E400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
+ L0 y( y5 `) h q$ I/ N8 r在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。1 J$ Z; o- n% C/ k* v( G
六、综合比较与策略建议
3 [5 z) _! D4 Y V6.1 区域维度:在哪里建 AI 数据中心?' n. O9 g4 ?8 m. u6 d
纯经济性(TCO/tokens)排序(假设无政策/合规约束):4 Z2 ^3 N- j0 }% H7 T( C
3 D8 W# O+ G p' z$ m7 H/ m# E
中国西部/北部(电价低、人力低、建设成本低)
& V- K0 p( ^5 X9 `2 [中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
/ l5 F) Y( [, R! P- U' G美国电价低但人工高;东海岸/加州电价上涨压力大
, P+ k7 |! ?& j* n( H欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
6 l9 o' Q: ?$ E3 a H4 U7 u若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
; P2 \2 f* A& `) y4 ?" i5 F) H. g
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;$ X6 B0 d- M- M, R. M4 |* U
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
$ F! K1 {/ y2 T4 b但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。: `4 d0 \! g L# i1 k9 i$ |
6.2 技术栈维度:选哪家芯片/云栈?0 ?( T# ?1 a$ s6 L5 ^
若目标是全球最优 tokens/$ 且不受出口管制:/ H) r% m2 D* a: ?( r" W" w
4 K- q# Z5 Z% P" ?4 T, e% ]) F
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。4 g) y5 x6 L8 g
若在美国/欧洲,能自由采购 NVIDIA:0 K+ @* A$ v: i4 m5 P
& P* [0 [% S1 s& \! {短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
( ]* P3 Q% l0 c' r: M成熟的软件栈与生态,极高的 tokens/s/GPU;$ a9 U9 c& d$ M3 R7 L8 \
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;# [: P, k( @, [0 T+ U
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
+ b7 p6 @% P* ^- a. T* `; h$ E- q( e若在中国或存在出口管制约束:
; H/ U9 Z% F1 D0 U9 y- T( x: j2 x# a" O1 m3 b% \, [
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
" A9 w/ r8 ^8 |) }) e性能上已能覆盖大部分 GPT‑4 类推理需求;2 G' R" @1 B6 N) ^
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;* ?3 k* H. b' v. ~+ d! F9 I6 g0 T4 N
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
+ i9 f2 y; G! a$ E {建议配合:! K0 F5 \: i/ g, k, Q' V$ Q
高效液冷(PUE~1.1)、( a5 l9 k+ h9 s0 ?6 P/ t
大 batch、路由(浅层任务走小模型/低成本芯片)、
2 Z+ G8 t1 r/ R& k. S/ n Z强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
9 U3 Y1 N' ]3 _3 g! ]长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
8 ?+ V8 r3 Z' f* c2 v7 s4 i; z$ y
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];6 R0 P& e: C4 S) i6 A" |
这意味着:4 D; {4 v" f' }$ j8 |
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
! a6 z; A: L( }2 m9 B1 Y* G1 F精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。5 x4 V/ M7 O6 s6 O$ F; z
6.3 针对你关心的具体问题的简要回答+ Y/ A0 R7 R+ P- S! c1 A. I
AI 数据中心建设 vs 运营成本的大体比例?2 H+ J$ |8 L3 I# [9 v2 y& x
4 V: @3 Y5 Y9 l9 M. l
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。 b2 r; h' F7 b0 K& o, }
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
5 ~4 @$ \' D8 n6 j- Y+ T3 X7 v中国、美国、欧洲、中东的成本结构区别?
, p: O! z" e2 s/ x5 E* G ]9 P9 b" Q s# y
建设期:
# g: a6 F$ c# l2 @- K$ v' m; Q中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。, N- Z# b+ k H
运营期:) f& ?* l# ?1 m7 T! F$ L
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲# K3 j" ^" x# H! B
人工:中 国 ≪ 美 欧,中东居中。
% k! l" m+ ]' h在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?/ T9 \ [3 o3 d/ ?
3 L% E2 M+ Z8 f$ G
对于典型 1 J/token 推理负载:
$ m9 d& d Y6 r* F- p美国 $0.30/kWh:电费约 $0.083/M token$ t+ d$ @* T, w r5 N' e S1 o
中国 0.3 元/kWh:电费约 $0.012/M token
3 [4 N5 C, {" h. w8 p对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。/ m; k. h" n n- G2 ?, b
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
4 p- Y( h/ Y2 _; |; ^2 E1 |4 D' C- o3 \! J# Q0 S! G4 s% g
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;
8 W& K: `. V, E4 M4 o- ?- c( W4 E全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;& f1 n/ ^$ P7 J" ^7 z" z$ E- e
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|