TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
# `! N! k' j G1 l4 X6 v
n; T; T; U p! a9 g( b! y/ C8 Q一、总体分析框架与核心结论
5 z2 ]& C: q% e1.1 分析框架概览( s7 w- ~, x3 m5 D7 V' A5 V0 a( [
拆分维度+ t/ T" b2 u2 O- h2 _7 ]! Z5 N8 ^
4 t$ L" O3 _; w: f2 v& I6 `阶段:
* M. H" d; Q7 |9 k3 m建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
+ U: H0 X) Z J# g/ e0 \运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
0 U$ E/ o% p, ]+ _1 p) i; @; @区域:
- g; G+ I# x8 l6 z, @中国、美国、欧洲、中东(以海湾地区/UAE 为代表)* `: P2 d% b8 @; D
技术方案:
' K- J. P# e% _- ~; z9 f: W) yNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
' c( d. e+ a& x' x' AGoogle TPU(v5e/v5p/Trillium 等): C' B3 s) n" n7 H4 s' J" o9 r0 Q
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
# h" `' C- M8 X算例基准
' C& _/ ]) _! ~0 A0 g o' k# Q( h3 B. {( u7 D, _# E! D: @. L/ ~
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
: e7 s7 Z: } K s其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
% ?" K3 Q% H! FPUE 假设约 1.11(高效液冷场景)[1][29]
% q) C) d" a" f* y0 Q L时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
" Z* R B9 F; o关键指标
: ~" p# p/ l# _/ v$ P
2 h$ h) K1 r) M4 H P$/MW 建设成本(含/不含 IT 硬件)
+ D- M/ P* l! N. L9 ?) n2 V$/kWh 电力成本、L/kWh 水耗
$ B7 k! {# R% Q6 x$ c/ E# a; Z$/token 或 $/百万 token 的综合成本7 k. l7 A- W. D l1 s
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]; O3 @, [0 l9 J( v1 c" L; ]" g) K
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租) ] q4 @3 f- _; V% d$ {" h
1.2 高层结论(供决策快速参考)
* O5 Q; Q* M/ V5 k+ }" K) e+ u建设成本:AI 数据中心相对传统云数据中心成本翻倍
+ _/ Z0 I5 H; L/ g: `( r3 V+ Z' G6 @
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
0 A( O- V3 f2 T- k, ^3 T. ^4 AAI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。4 h! @3 f# k; |; V4 Q0 z3 D
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
! g- `3 U6 n/ |9 F: S7 c2 g+ q区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区& _2 s& N, A) r4 J& v
7 R5 x# R: e& v% J; H: T9 Q. a" m中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
9 c, Y! o( j: M x/ t美国:$8–12M/MW,400 MW 约 $4.0B[1]
( M1 P1 z' F- z" R$ X% v欧洲:接近全球平均 $10.7–11.3M/MW[2][41]: i! s8 P" e( c0 x4 k
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]0 \( m8 s. |/ g7 s0 g
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
3 n5 }6 a( I( a0 L# l" l# A- {2 MOPEX:电价与人工决定区域优势9 V; w1 ~( i! G! n4 v' `4 k8 ]1 y
& ^1 N3 n/ b# b! F0 e. U! ~电价(2025–2026 工商业大致区间):/ i. c2 r9 t7 |) Z- Y
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]/ q0 k6 A" S: @1 E: v+ Q
美国:工业用电约 $0.085–0.09/kWh[44]) }* ]5 Y8 W. Q2 J3 E+ F
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]1 _' a# j L2 U: |
中东/UAE:工业用户 $0.07–0.13/kWh[47]! J4 S' C9 b. x3 g' r
人工:/ s1 S1 r2 D) L4 F" b
中国数据中心运维:约 $22k/人/年
8 q2 F$ x- X) x6 d; L; V0 P美国数据中心运维:约 $120k/人/年[1]
7 O/ G, u/ O" ^! V. r结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。, Z6 S# W$ Z L9 M; s k; A1 A
能耗与每 token 能源成本:能效差异远大于电价差异
! b. L x* O: ~$ u. E
& ]6 C# W& v, n s" U/ j! WIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。5 l5 ^2 W/ L- k, G+ b$ g8 E) W$ S
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。; k" V7 ~0 f9 {2 R
将 token 能耗约化为统一口径:
# Y- f, K) x* N粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
7 s' q1 }5 T' }' {0 e0 H8 o, {" M中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
# B; e) Y$ q* ^' s8 ?( S2 M$ ]美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
& U% m1 p9 D; a对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。1 Y; a+ m z3 \! f5 F
不同芯片方案的核心差异
3 f- J! T7 k5 [. ]' x
0 E* D. ?4 f) lNVIDIA Blackwell/B200 & GB200 NVL72:
& r q: N3 g3 T1 T5 U) a/ H- s& r3 H单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。; O8 |% Y5 Z! r6 [/ {
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。" d: H# S) i, Y
Google TPU v5e/v5p/Trillium:! r+ Z( |9 n& C7 J7 f9 I
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
3 h3 K, q* q K2 A0 eGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
' A2 b8 E# @4 e3 c) P. B华为昇腾 910B:( R: Z5 P& m, t0 t- e! G3 U# [
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。% @' g! H! H( F
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。# O4 V9 j2 L. g" W9 M
阿里平头哥真武 810E(Zhenwu PPU):
" m9 q3 W, I; F+ }6 {" g7 u8 y96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
3 d1 V) n2 S( ~$ j9 K; J* ?结论:
' o9 k m* l" F& C能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。- n6 k/ D2 H% \) P2 s6 c
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
! W+ ?3 o9 g6 s+ G对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
% y/ l- @/ {, Z4 R自建 vs 云租的 TCO 与 token 成本
8 C! F( C$ k- w3 A2 O1 a9 \5 }9 @; Y% y% ^6 G, N& Y
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:" E7 `/ k; q: a3 ?
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
: M/ `+ X/ D; c j3 B等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
( }$ `. _2 V9 j/ b0 H, ?; O! B: F' H8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。8 V5 N g1 \# o# |. e$ a& [8 T- l
Token 成本对比示例(LenovoPress 场景)[28]:
- }) p+ `1 ~5 q: Z5 uLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
" F6 I) G4 }$ ^1 bvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
9 b" t' s, x# H$ U% _) h) U+ p* C3 F8 f同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。8 x U7 A# V+ K1 ]+ _% F- v
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。/ u5 O3 V6 v( _
结论:. H, h2 j5 ]% y6 `4 f
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。 o0 p1 G) R" @9 }7 j7 ?
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。! L& m# R1 J* O. j" b" X8 a5 O
二、建设期成本分布:区域对比
: l$ {9 H" g7 T) S4 t& O以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。/ T/ m: i3 i1 l" @5 E
s+ m9 T+ w4 f& n. S$ E. M* n
2.1 全球/通用结构(以 1 MW 为单位)
( B3 M2 |! z. c( v; z综合 JLL、ConstructElements 等[2][41][40]:# G/ ^% o; q. \2 z) G8 {6 \7 `
' ^& h7 p4 J0 b1 d! d壳体+机电(Shell & Core)% \4 W1 A/ o+ a3 D
) z" X/ s1 m- R! `& C3 ^1 o, w全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]/ x* |& g# i }
其中按成本构成[40]:7 I- a2 [! N5 N' i4 |/ T; _
电力系统(变电、配电、UPS、母线等):40–50%5 T1 z" |0 ?- z# m4 a/ |
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
0 g0 t" v/ Y) b9 d' I) C建筑与土地、结构:约 15–20%1 S5 S2 h) O/ i& g1 \
其他(消防、安防、楼宇管理等):约 10–15%. S3 B0 M$ J# B+ s/ D7 {
IT 内装与 AI 基础设施(不含芯片)
2 O# F- }) T J3 V- t" O9 a5 F) S/ t* ?- w$ z$ K# Y& t5 L
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
0 z3 }1 h. B& M F5 l* X( LGPU/加速卡硬件 CAPEX+ ~9 b0 o+ M. Y) ^9 `8 n" h% W
0 H" U+ U4 K6 ]) G2 O) A
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
5 R+ _7 p0 @* K$ l0 S" ]: p! E2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX7 o6 w/ n2 m/ k' ]7 f) ?( R% ]* _2 s, {
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):
2 g+ t, M3 O& @, O
3 V* r8 o( F: ]0 d* k' y/ P; c4 g9 `8 P$ t区域 典型建设成本(壳体+机电,$M/MW) 备注/ R! D3 I6 ]0 L1 {7 X; ]. [
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
! _: C) J; |- d- R美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]7 m* }( v. w; j+ r4 U$ v9 J% x
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]0 }. b8 {2 W2 }8 K8 h0 y k7 S: @
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]( G A' `1 m# k( R! V a
结论:
* v- K( E0 f% {% X& ~, n; v8 Q- L! S7 D! L$ D! U
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
, F- t% P' ]7 q( w- A- k+ \若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。% y$ d- W# @ ?/ p7 J8 B8 O8 h
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)* n/ [9 D7 t# i R
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:0 ]: u8 a' Q5 P+ n* X' r5 {
9 ^& V: F1 W4 F5 {4 l. d' s+ Z假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;1 y- e y! o0 x" T3 A2 n
GPU 配置:
- D9 k& B. g, S5 \4 F! \, ~; @: O有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
- M" G1 G& t" l. ~; b每 rack 成本 ≈ $3.0–3.35M[34][69];
0 B! F4 m+ x/ x. } QGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
1 l" @/ R* L9 B' D4 Z4 D: }% j! v与不同区域壳体+机电组合:- \/ U6 I: h. Q. r H
: k# E3 C/ ?5 b! f5 z8 X8 l2 i# A以中值估算: f& o* S4 s3 C
' [0 {" h. ~/ {/ b! `
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
* r/ x- N2 e3 r6 J' \美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
9 u5 y$ Z" G6 }8 M# `: p/ R0 K欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B: s/ o+ H# f9 h8 x% v
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
, Y, [2 D* ^& A, z4 }! U可见:( ^( e9 W* m. m" T% }; o
4 B' Z! b6 ?, n5 pGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
$ \; J! x( F V0 i+ N相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。3 o2 i/ M w# j9 F- Z/ B: |: i
三、运营期成本结构与区域对比
1 v4 R1 ^3 w: _" z& d3.1 通用 OPEX 结构(高密 AI DC)
7 t! X0 W. [7 p7 |. A结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:3 E4 A& c+ R6 \. d, A5 w' H6 J( C% @
" n7 i8 x7 z2 j k# c# T, [
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。) }2 S) c( i9 M$ z6 Q5 g% O7 ^! F
冷却与水资源:. x, c8 `4 G( `! z* h
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
# P1 I' X; y3 I水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
- J2 l ]$ `1 G3 K |; e- [人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。. |% t3 c& u0 {% Q- `
托管/物业与维护:2 ^, p% Y! W% r. i0 i+ j$ F
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
5 N8 h3 N$ c Z u硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
U+ P0 d: i9 Y8 {3.2 区域差异(以 400MW / 3 年期为例)+ A; r9 D* P8 y- \" n$ L
使用 ChinaTalk 的电费与人工估算[1]:
/ {; O/ q4 V' |( C( x# B7 d1 P8 v. T& i% q
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:+ w" l# s: k. l6 A
中国:约 $0.06/kWh → 3 年电费 ≈ $350M
& x2 `, i4 x; A美国:约 $0.09/kWh → 3 年电费 ≈ $600M+ e' J/ J* m E! _) S
中东:约 $0.07–0.10/kWh → $400–550M
4 u& c0 j4 C6 z% j) ~, P3 j6 ~3 i欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
% E# [ t: L, |水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:, F6 t y. }% z
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]9 @$ ^7 p! m) u; {; T
三年水费级别:
' u. x' F6 S9 a美国:$40k+
; i% X1 i% \$ ~中国:$20k+
9 n7 D1 F& N6 O$ U8 o结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。% V9 d5 z* E; }1 M7 s# u$ Y; p
人员成本(3 年) – 假设 500 名全职运维:
0 Y. a! W$ L1 s& ~8 K2 s美国:500 × $120k × 3 = $180M+
2 o- _, N/ N1 y B& \9 t" R9 H( R中国:500 × $22k × 3 = $33M+9 J: D7 z( W/ [" Q5 |
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。2 d; Y7 T- ?& {5 K) G$ P
整体 OPEX 粗算(3 年) – 400MW 场景下:
& c V5 a( F* B0 J
. t; d- k3 P. T* _" m) H9 ~项目 中国 美国" s. K* m8 y; A1 |4 Y. L1 H3 l
电费 $350M $600M
1 f' a, p. G2 h1 m# R# N水费 <$0.05M <$0.05M0 T" @+ z7 q* o8 g( u
人员 $33M $184M
. x6 s R( b5 G其他维护/托管 同比例估算,地区差异主要体现在人工与地价 5 Q2 `, f. E) V# |+ Z
结论:2 m \' [3 Q7 W- D) T
8 X* N( U: T6 M: Y' j8 D! G h就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
6 [8 J; b9 |$ ^2 ]4 J2 Y对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。3 Z/ w6 o, H7 Q6 k3 t$ E
四、基于 token 的成本与利润推演
$ X7 J* N7 [' N. U% l% k& f. I/ l3 L4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
5 \) R3 A' |1 p' V- n# S6 G3 }: z1 h统一假设:
8 @% ~ K- P4 H7 r1 P; w* I+ Y$ \0 N
" o; }0 y+ U5 h& C% ~( A典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])* F0 ]# A. C3 X5 u
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh2 t/ D! `- V' v2 v* L
1 百万 token:278 Wh = 0.278 kWh- {0 y9 a5 D( s' R
场景 A:美国电价 $0.30/kWh
7 R' E: g+ l' F- v: i* j I电费/百万 token = 0.278 kWh × $0.30/kWh
: S% q' m9 s% P+ K# u4 L≈ $0.0834 / 百万 token
. Z/ j. W: `' j2 c) g x) C场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
: `# k5 t7 c1 Z& u. y( U/ g电费/百万 token = 0.278 kWh × $0.042. R! Q/ T7 {% Z% E4 H) h5 S
≈ $0.0117 / 百万 token
0 [7 E) M) _1 e& L: S/ k* ]* t对比当前 API 价格(OpenAI 2026Q1)[62]; a9 v0 z3 s% ^( D4 d( Z
以输出侧为主(成本最敏感):
d& e- V T* ^: M. I$ A2 m! Q; a/ B7 I: R' C* l0 E
模型 输出价 ($/百万 token)# s* z8 h4 ^/ T0 R# S8 u4 p
GPT‑5.2 $14
3 T1 [6 j0 M& G/ jGPT‑5.2 Pro $168
0 ~/ x7 t! b3 R m# a& u; Y& nGPT‑4.1 $8" P0 E" I5 q9 I+ i1 _, v/ ^/ G
GPT‑4o $10% ?" R1 A0 R! ?1 N5 d' Y3 K/ i
GPT‑4o mini $0.60
" I5 k. D% A* W" R& ]3 B则:
* O: q8 \4 \$ s: _. g) ~- w2 i; j0 [- ~# `5 p
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
9 K, w1 E+ [# o: R3 J o在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
' O, B6 H% ]' F# j+ z9 }9 K, U2 E2 W+ ^相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
& A6 u) V" k* z7 Z7 {, }2 [1 O结论:
( [# q1 L7 }; q" r0 @0 E5 L即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。+ ]# R$ C) V: M& D! g, j
9 p' D* k2 y2 k, m2 T) j# E# k4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)) ~; q: V, c& s& _$ m
以 LenovoPress 的 8×H100 Config A 为例[28]:$ S T9 U! d8 N7 E
5 k, [8 s5 ?( }# k/ a C' f5 年摊销下,8×H100 本地推理 70B 模型:; @. N2 T2 B3 r& |$ M; \0 x! X5 D
小时综合成本(CapEx摊销+Opex):$12.08/h
0 w* |, ^8 K6 V1 ?吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens6 r5 ?9 o3 q+ F2 C9 c
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
: k( J5 u, h4 S7 t! C' Z电费在其中的占比:" ~$ X3 U( a& z' F6 Q1 J: b5 G/ Q
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]
6 O' p/ J. M5 D- d% H: V- m- j电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
/ @9 f1 [2 K9 a电费占 总 token 成本 ~7% 左右。
+ H8 g0 a0 F! R% e! o若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
9 ?" s2 N9 Y" B7 q! d% s; s" f若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。# b3 w9 p7 j5 l+ z b' N
1 o" O5 q+ u+ e! ]& |6 r
因此:' d2 B3 ` R2 Q5 {5 @; G& f
1 B$ W# ]8 S% S( m! h# h' _6 K1 L, A在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。: i) @' o5 f* U- L8 x! h
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
$ E* s) Q" i( ], e( t- G& m2 V0 O五、不同芯片方案的建设与运营成本对比
, \, `2 d; f- n4 y5 I5.1 NVIDIA 方案(H100/H200/B200/GB200); `; V/ G. [, ?4 X: f; j+ n9 U
CAPEX:0 o! N9 S9 C, w; F
; e+ x4 A; n: q4 UH100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
# n, p; ?, c, A* o' NH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。1 A. i- D* ]/ H: v
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。: v: w2 L4 ]6 T1 K- [: C3 w K" D
GB200 NVL72:/ ?0 U$ m/ C( b3 y0 ?! x
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
& b+ `4 s) W+ e2 d# k3 ^$ Z' _冷却系统每 rack 额外 $50–56k[35]。9 O' x) p7 n9 G( y7 s/ ^
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
4 R6 @1 U6 _' g: T0 S$ f9 DOPEX & 能效:
1 S6 E- \+ u) [- M _
5 X3 H/ u" {! v$ O8 m9 ]6 V& G单 GPU 功耗:
4 p. p4 S1 ?" J1 \H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。" @7 A+ [% E7 z# {" Z" Y% Y
H200:功耗类似或稍高,但性能/W 提升[9][10]。
; w9 R; ~. i1 O% n {: l- J6 WB200:标称 1,000W TDP,但实测约 600W 左右[68][69]。9 y% z% f0 X. c! \; y x
Token 性能:9 v! w; [: E% M8 I6 y' x: {' U4 ^ ]
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。7 W i* |& z8 P9 r
NVIDIA 的优势:
. s3 `1 F1 W( l$ a
) l; W/ [, F& m9 f3 o! M软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
( R' L$ H9 m0 F2 \但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
6 w9 ]4 `" e5 H9 G* r: @5.2 Google TPU 方案
" f9 M# w- g! LCAPEX:
; e8 j4 R: v3 U% ^8 `& c
" a) w; {- Q1 m/ ~7 Q' T. m$ h单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
, x# J$ Q; q9 m3 ]0 ZGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
- V" K( c( I7 ]3 O1 U8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
2 p5 W Q5 K9 c1 q ?" K能效:5 i3 o- U! U W: B3 p8 j/ s
+ B* T5 k+ F5 a, N* q
TPU v5e vs H100:
) b! @" e. s' G) h6 T; ]同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。+ j6 c- \* O; c/ ]) f% \4 Q
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
! D0 z& x, o9 s新一代 Trillium/TPU v7:
9 f( Q8 v; ]: @4 @8 d3 N能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。9 p! t* N x4 @* Q! C% P7 |
Google 方案的特点:; J/ q6 s+ w. S* Y3 {
* E9 e1 ~% F3 l) K) v自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;, I7 d: A) i& x
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。. s2 [* b, R/ [& i3 m8 {$ v
5.3 华为昇腾 910B / 910C 方案" k: A9 Y* H1 Z1 i8 @
CAPEX:2 ~) C" L1 i. ~) ]/ ]8 y5 K
1 i0 |4 ]- P9 G2 L. D. c/ M; |单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
/ c# Z+ a( N+ a( q' L: }与 A100 对比:+ @; ] D- h8 o- h5 O+ d
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。) Q- Q, v$ F' f
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。" M* w. s; ]. q) \5 k$ j. [
使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
+ e& E3 z8 A# t0 jOPEX & 能效:8 N% c4 P/ K; a+ ]
" q5 M; N5 D5 u$ _
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
: p' W2 ~ w7 f& P部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。 R8 t0 p& P: L+ C! S
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。7 _, F4 U7 G4 M- T
5.4 平头哥真武 810E(PPU)方案
! g$ m- n# g% f/ D- T, [CAPEX:
. O; Q! f$ N, Y3 N( O; f& O% D* L: H m9 A9 Z; f
技术参数:
$ [/ _2 p5 V' h7 \" _4 h96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。, q$ O! D5 m. f
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。% L& v5 ~* x0 m0 c' Z0 m( Z0 p: N8 \
价格:
1 F- g/ O1 n3 [; v1 G# ?. x8 _未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
2 M. R& ?& }1 e* ?0 W3 Y& x结合国内报道:0 {4 [/ Q9 v* [. Z: C9 B
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
% d$ P+ Y) E$ d% ]1 ? P数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
/ v X) W9 x0 u, ~) VOPEX & 能效:; r2 K; h1 `% ~# |/ x; H; g) }* _
9 b' ^3 N) M& i: I3 W. {7 @9 X' |400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;- ~, @. l" X q: E& _
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。$ A/ S9 }( B7 K
六、综合比较与策略建议: I7 I) ]4 k2 J" ~9 H' x
6.1 区域维度:在哪里建 AI 数据中心?4 m. z6 I4 j* }: H+ P4 g
纯经济性(TCO/tokens)排序(假设无政策/合规约束):! n# t1 r6 e3 J' i7 i# k6 y+ _
" y# U7 M3 g; ~( i6 c' e( f
中国西部/北部(电价低、人力低、建设成本低): z/ j# C3 D E. }
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)% n6 c$ {# R5 C' I/ m
美国电价低但人工高;东海岸/加州电价上涨压力大
0 i2 T, {7 Y) x" l& H$ ^; G$ ?2 K- n欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
7 z, b) N( B O% L& k8 Z1 B! E若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:4 F7 s; T7 x3 t% `' r
1 i4 K. V, S5 g( R+ z' l9 G! F4 Y
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;% l4 Q& W4 L7 U! N
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
" O( j# y3 K1 a! j N4 Z" ^' d但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。% }' }, O# D6 e9 R/ {" v: }# [4 L
6.2 技术栈维度:选哪家芯片/云栈?0 W0 F8 X3 R# H3 r/ L/ D) l
若目标是全球最优 tokens/$ 且不受出口管制:. G# Q8 z( k* s) F
# o- m" f, p# `+ A7 S; h
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
/ d# i0 [( u( Z- X若在美国/欧洲,能自由采购 NVIDIA:
# w% f3 m+ t! q! F1 p, V# [/ F& ?* Y" h; \) s& T* m9 B
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:: i# _4 I+ ~! H+ Y9 E
成熟的软件栈与生态,极高的 tokens/s/GPU;
0 o+ n& Y& o2 e* u在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
$ M* U% C9 x- M, ]但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
4 z+ m. `. J4 s! y$ D若在中国或存在出口管制约束:- P( e8 g) `9 y0 k8 o5 i
) d& I& _( J$ x& I, J2 g( x: N' t
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:. W, h* O. p! K5 s' R6 _
性能上已能覆盖大部分 GPT‑4 类推理需求;8 Y* u* E, ~0 w# U* b% l i7 S
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
7 v* F r) ~4 r5 p3 |# i软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
3 d$ ~0 {0 e" j$ K; x8 B6 I) k建议配合:6 X% E* T! h* ^* J3 e
高效液冷(PUE~1.1)、
$ B3 \, k" z H" x% u& u+ a" M大 batch、路由(浅层任务走小模型/低成本芯片)、
. ]2 C' Z# ~7 A/ a强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
) k# [4 s ] B8 @: b" d3 R长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:& y* T/ J. v) v
3 v* U( e: _! w5 m数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];5 \# P# K N G% X; n# a9 S
这意味着:5 ]+ M% r: r5 D( e
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);$ j0 ^$ G2 t0 Y& C/ {/ i6 o
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
3 O5 _4 M' J# j/ R6.3 针对你关心的具体问题的简要回答, l& i: L) W0 ^* ]* r
AI 数据中心建设 vs 运营成本的大体比例?
# I7 _8 w$ y" X f2 R n5 O/ e+ E7 q# _7 B" p
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。4 v: N! B- d i _- J8 l: Q2 f
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。% W% L; m% v' B- _7 ?
中国、美国、欧洲、中东的成本结构区别?6 J; r# h; {8 v t1 H% \
$ r) S! O$ `6 J1 H建设期:
' f7 L6 U6 A3 a( t' q' I- m0 \中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
3 W+ p0 L- Z' q4 F运营期:
) u9 H& r3 `0 d- y3 |; d" J$ n电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
9 ~7 n7 O( f X人工:中 国 ≪ 美 欧,中东居中。9 ]& h3 Y" ?% f% Z" a
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
; N. P* ]8 c( o0 {
& M2 z7 v$ O B6 p对于典型 1 J/token 推理负载:( q) D: [9 w5 n. a# o
美国 $0.30/kWh:电费约 $0.083/M token
& Q' ] i. t* b7 Z# G! A3 m( H中国 0.3 元/kWh:电费约 $0.012/M token
0 o; x) [9 t. \! j% N( O9 g对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。- j4 u2 E; _- `; ]1 D+ |* ^; ]$ K
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
, z: K: e g# Q* s# D/ D* c; f" a( |8 @1 v V6 q7 |7 q3 E
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;1 Z* _0 H0 @+ M& H8 `( M4 c
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
8 ?2 y8 r- q% _! S \中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|