TA的每日心情 | 开心 2020-4-8 10:45 |
|---|
签到天数: 227 天 [LV.7]分神
|
玻璃之翼降临——Glasswing计划与Claude的Mythos Preview Z2 t" X4 f; a% h2 P3 H
! [+ f- ]9 `2 q" U5 |, }* N
; E/ i7 l# A: K5 s
一个预览版的AI大模型刚刚挖出了一个尘封27年的漏洞,然后11家科技巨头都坐不住了……- j2 }. Y, r' I2 g$ X
& E( Q: ^* L* d( x5 J- Y
故事是这样的。9 c. i, j6 y4 ^: |
" F- T* b& ^7 H7 |% z. f我今天看到这个新闻,看完之后愣了好几秒。! ~8 h1 x0 s7 D. }: n3 K
& A# B# Y2 }& k( g+ z
一家叫OpenBSD的公司——做操作系统的,算是安全领域的老前辈——他们有一个漏洞,在代码里躺了整整27年。1998年写进去的,没人发现。4 n( P( P C, i6 ~, `! {% O
1 U! s6 }9 V( K结果被一个AI模型给挖出来了。% o" P/ S: m+ \6 O: @
. x& W9 @5 U, R( Q* E: v* x这肯定不是那种"我们用AI扫了一下代码库发现了问题"的挖出来。而是那种"这个漏洞藏在最核心的地方,所有传统工具都扫过5百万次,一次都没报过警"的条件下挖出来。' g/ s4 R, J( ~6 I
# J' O2 g* z- J! q, \然后,这个AI模型,顺手还把FFmpeg里一个16年的漏洞也给挖了。
" y1 H: \1 c" S( [/ I* ^. C/ O$ f2 O9 I6 J; E; C
FFmpeg,音视频处理领域最最最核心的基础设施。全世界的视频播放器、浏览器、直播平台,有几个不是建立在FFmpeg之上的?这个漏洞在里面藏了16年。5百万次自动化测试,没一次报过警。9 ]( m3 Q) {% G; d
. g. _* G9 X7 y, h5 H# Q3 \然后呢?! ~& I# ^% G9 X" ]8 J) s
, v! U, w! E! u1 D3 \0 M然后,11家全球最大的科技公司——Google、Microsoft、Apple、NVIDIA、CrowdStrike、JPMorganChase、Google等等——坐下来,说了一句话:我们一起出钱,让这个AI模型,能被全世界的安全研究员用上。
1 B3 v& N4 H8 R) `7 g( r# Q- U, |& R% c D* d1 H O0 E, w+ k/ f
这个项目,叫Glasswing。# }9 e/ ?/ A/ g- t
/ r: ^: ^2 l) M5 r3 I( pglasswing8 s7 S8 O- S0 \3 ?. h
+ j4 E" g! Q0 S0 ~* y8 P
% F& m- ~6 |( _3 g& L7 F: h h先说清楚Glasswing是什么。; c8 U% U$ g" Q6 y7 G( e6 Z
9 x. ^! k5 P9 D& b6 q5 d# k
简单说,它是一个AI安全联盟。发起方是Anthropic,加入方是一堆哪怕是不关注技术领域也叫得出名字的科技巨头。它的核心,是一个叫Claude Mythos Preview的模型——注意是Preview(预览版),就是还没正式发布的那个版本——专门训练来挖漏洞的。' A: U# S7 x; S1 M' h% |
" u! r6 L3 ^' r6 Z8 l$ x3 F( G有多强呢?) G5 D5 e3 V& Q, `# m3 k0 b+ B
' x3 u) I7 t1 g0 G! L' z: R
CyberGym基准测试,83.1%。作为对比,Claude Opus 4.6,得分是66.6%。不是Claude Opus 4.5,是Claude Opus 4.6,Anthropic目前最强模型。
+ E' ?5 ~. ?5 t4 U
: @# c2 Z8 o3 W. K0 U0 lSWE-bench Verified,93.9%。还是SWE-bench Verified,不是那个容易一点的版本。Claude Opus 4.6是80.8%。8 ]( {7 _# e( {* U
z. W) `6 l5 N0 J1 w8 ^
差了13个百分点。" P& i) p. s& Y5 }+ }3 u1 N- X* H" e
2 M. ?+ Y% Q; m" _: a* S
你说这13个百分点意味着什么?0 ^/ \ B- X, y" g" ]! \. K( b
: h+ |. a' }3 o- X6 O: R B意味着,传统扫描工具漏掉的那些最刁钻的漏洞——那些藏在层层调用关系里、藏在异常分支里、藏在并发边界条件里的漏洞——Mythos Preview能找到。/ L! V' X" m, f( f+ v
% V. \- X ?6 {5 t2 y意味着,27年的OpenBSD,16年的FFmpeg,以后可能不会再有了。
' s; [( e) T" E' i
" x" c4 j/ F) v! s或者说,这种级别的漏洞发现速度,会比以前快几个数量级。
9 [1 y# i) c d4 [& q
) X" t+ x- m: x4 X; `说到这个OpenBSD的漏洞,我必须展开讲一下,因为这个例子太有意思了。: D3 s9 ] Z* K( v8 {, d
7 X- ?' H+ j' |4 aOpenBSD是个什么存在?
8 Z) R b( F) Q+ ~# C4 b5 E
# o; i, C# H+ _它是BSD操作系统的一个分支,最核心的设计哲学就是安全。代码审计之严格,在整个开源社区都是有名的。很多安全研究员的信仰级操作系统。/ R4 C/ q% u- x! V$ `
Y" s+ @5 U* H; T
这样的项目,代码审计了多少年了?二十多年。
' S. j% _7 Q8 G8 Y" y0 ^7 Z
H5 ]4 b, Y( E8 e' Q5 Y0 A( F然后,一个漏洞,在里面躺了27年。
6 ~- y2 X0 w0 a; [4 v+ p& K" z: r. p2 T r, e$ C+ Z9 F8 H4 K
这说明什么?
W% u3 D8 x" {! U* d: P
# D8 n, ~ D& t* T不是OpenBSD的人不行,是传统的审计方式有盲区。任何人工审计,只要时间足够长、人足够累、代码足够复杂,就一定会有漏洞漏过去。这是人性的边界,不是能力的边界。
- b- ?6 A9 G: W3 X @' N
6 @: l4 ?- q+ N9 ~但AI不一样。AI不会累。AI不会因为审了三个月之后注意力下降。AI可以在几个小时之内,把整个代码库的所有调用路径、所有边界条件全部穷举一遍。
! j ]- o- T/ Q* y9 X" v
* u+ g& U) n; _& ~1 |* A4 Z/ RMythos Preview发现的那个OpenBSD漏洞,是一个本地权限提升漏洞。攻击者如果已经拿到了一点点访问权限,可以利用这个漏洞进一步提升到root权限。
, v6 |( U6 q- \8 `8 \: @& A I. i( N) q3 @5 s5 u9 P
这种漏洞可怕在哪?! j4 [1 X" J8 e/ r) n- |
9 n" \$ p1 e6 t" d# n
它不显眼。它不是那种"输入框里填个单引号就弹shell"的漏洞。它需要你对系统有相当深的理解,才能构造出触发条件。; u7 h/ |7 X2 Y6 A; Q/ K
% S6 T" ^- n9 V4 K, x1 W传统扫描工具扫不出来,是因为它的payload模式不在规则库里。AI不一样,AI学的是语义理解,它不是匹配特征,它是理解代码在"想什么"。: h! ~$ q5 X% {, Y
3 I' ^; G g9 KFFmpeg那个例子更让我震撼。
( O; K$ c1 F6 i4 D1 z) q2 M
- t3 s6 n# U w) K* M16年。7 P6 K8 c4 k& |$ \$ Y
* `+ U+ n$ e5 n& q$ I7 O
FFmpeg上一次发现这种级别的漏洞是什么时候?2009年。
7 c& B [0 a: r$ O# ^
A. d7 X% I0 U( i* A; l16年都没有人发现。然后Mythos Preview扫了一下,找到了。: I" Q) A5 U7 c2 r7 \) u
3 y# c. a& a; J* ~8 l% U
注意这个"扫了一下"的背景。SWE-bench测试集里,有大量是真实世界里的bug修复历史。FFmpeg这个bug在历史上真实存在过,是某次修复的时候被记录下来的。这意味着,Mythos Preview不仅能做代码审计,它能做的是:从海量代码里,识别出"这个写法有问题,即使目前还没有人报告过"。, C4 t$ G5 v. X; k0 R% s w' h
* \! Z. h, q' I" @1 t4 j/ g这是主动防御,不是被动响应。- } R1 X/ \) L7 u
6 Y: Y1 L" g/ l9 r7 a0 A
传统安全的方式是:出了事 → 分析样本 → 提取特征 → 更新规则库 → 下次能识别。/ ]# R+ \% _9 u2 K$ h
/ W5 N3 A7 _+ @' `
AI安全的方式是:不需要样本。直接读代码,告诉你这里有个洞。
4 ` b+ X6 h( L5 @
* V: O% f- h7 X% x( d# z这两者之间的差距,大概就是"等贼来了再装防盗门"和"在盖楼的时候看着图纸就告诉你这堵墙扛不住地震"的差距。
/ U) Z/ x6 q4 s/ s8 @% h
9 Y( A n, f* j% h# x& M4 Y5 X, V现在说说大家最关心的问题:谁能用到,怎么用,花多少钱。
/ X. q- Y2 { G* z2 i
9 W% t5 I, Y1 _; F5 \. v, q/ `5 iGlasswing的AI能力,现在跑在三个平台上:Amazon Bedrock、Google Vertex AI、Microsoft Foundry。
" P. {6 L& ?% p4 h! z8 }0 t
( p! j* K/ u. E/ N这三个平台,恰好是AWS、Google Cloud、Azure。全球三大云服务商。) F/ q0 o& u% g& ^
2 \. v; r, {) t: h& l* A2 h
你在任何一个上面,都能调用Mythos Preview的漏洞检测能力。0 n9 a/ a- v E5 s. R) \
4 w, ?. q7 P/ b- l z7 e2 X* }2 {价格呢?过了初始的credits之后,每百万token输入25美元,每百万token输出125美元。* G5 ^! @$ \9 b2 T) ?. ], Q
7 j% G! H' e8 o* x0 t- |/ B# M% Y1 |( k; N
这个价格贵不贵?
) X* v R' t2 k) h9 j9 a% A
8 x7 {, @! f v9 X* K对比一下就知道了。现在市面上做代码安全扫描的工具,像Snyk、Veracode这一类,商业扫描工具的报价大概是每个开发者每个月几十到几百美元不等。而且它们扫的是规则匹配,不是语义理解。 t9 e1 l c/ D+ ^; B( t
/ Y1 b" V* | K% RMythos Preview能发现那些工具发现不了的漏洞。
9 x& u, g% S' ?! c: H- ?- P5 e1 i3 Y( u5 ]2 q2 E' ]" V) g: }
这不是贵不贵的问题了,这是"有没有意识到你以前省的那些钱其实在交更多的学费"的问题。8 F8 q4 b2 N4 A$ F8 e
" s3 F" D3 t- X u& B' Q7 c0 \$ c
另外,Anthropic自己掏了1个亿美元的使用额度,分给联盟成员和开源社区。还额外捐了400万,250万给Alpha-Omega/OpenSSF,150万给Apache软件基金会。- C: P1 m# m& ~" v0 G& r1 P) i
# o: d7 a( k7 P$ M: x/ O这些钱是用来干什么的?让那些没有商业利益驱动的开源项目,也能用上最好的漏洞检测能力。% h( D$ |* N) O' R$ l
- L$ d6 o2 D5 Y' g3 R, V2 L4 f7 RFFmpeg就是开源的。OpenBSD也是开源的。这些项目没人给他们钱做安全审计,但他们的代码,运行在全球几十亿台设备上。
% V0 u# q( ~/ n; P: [9 s& ^8 j# p6 E: }2 n
还有一个细节,我觉得特别有意思。6 r5 L @2 d% ]$ L0 Y* G: u
7 X: B& U5 M" X" j
漏洞发现之后,公开披露的时间是90天。
3 s# w" `: s" X7 n" V; H/ { T
+ Q" h5 _1 f Z0 X, S1 F. s0 P90天是什么概念?
8 t& g( T. l. i/ @: Y
+ i; L2 I6 H4 x1 a$ X行业标准的漏洞披露窗口是90天。这个时间足够让厂商评估漏洞、制定修复方案、推送更新,但又不至于让漏洞在黑市上流通太久。
- \# o2 q m% ]) }6 V. o: W( @/ V4 O
但这里有一个问题:90天是针对"有人发现了漏洞"这个前提来说的。: v6 a G) n! u& S
, n0 r6 v1 p5 }' I/ G- k+ }- X7 g, ]) JMythos Preview现在能以前所未有的速度挖出漏洞。它一天挖出来的漏洞,可能比以前整个安全社区一个月挖的还多。, j! `$ U- C* }7 J
- } { B W$ m. r5 R这意味着,漏洞披露的节奏,整个就变了。6 M7 Y3 L( U3 `, ]
' H6 A4 p' u9 U) a, |以前是"挖到一个,披露一个"。现在是"AI在持续不断地挖,每90天披露一批"。! k$ o" H: D; i* v4 u
- ?9 S0 O! e1 f6 V) l0 f) v厂商的补丁开发速度,能不能跟上AI的发现速度?
3 A7 ?* [0 \9 l. ~' ?1 m! W
2 G6 s! ]& S" @' d' B: _& a6 g这个,我说实话,不知道。但我觉得,这是整个Glasswing项目最值得观察的地方之一。- L3 ]* F9 s# F( Q3 k( N: z
y" d; }, ~( m5 T写到这儿,我突然想到了一个更大的问题。$ N* M" ?+ F2 c' j, h J! |
. J' x8 p b; L# f; `" m1 A
Glasswing这个名字,本身就是一只蝴蝶的名字。玻璃翼蝴蝶。它的翅膀是透明的,像玻璃一样。
' `3 S" ~# b4 b9 T* n; g+ v8 ^2 n0 B( X$ A
透明,意味着隐藏的东西变可见了。, w0 P' a0 F# L
/ O9 z& H; ^3 c) X, e. c
一只蝴蝶的翅膀是透明的,它就隐藏不了任何东西了。它在哪里,飞向哪里,所有捕食者都看得清清楚楚。2 M" n/ k4 {( u( a: {
" g) v5 O$ z) b5 b这个意象,放在漏洞挖掘上,太精准了。; M. A' J% G) W. s; ?6 y+ v
" u J9 m1 Y3 t+ q$ N
代码里那些隐藏了几十年都没人发现的漏洞,在AI的"眼睛"之下,突然就透明了。 B# @, t4 p1 \# v5 Q# P6 b. Y
, b# a# E( v1 |5 D5 ~以前我们说"security through obscurity"——通过隐藏来保证安全。你的代码不公开,漏洞藏在暗处,攻击者找不到。: B$ A$ l8 j: W6 P! _0 i: f
0 ~$ |( q6 F" X+ s( n' r2 [6 j4 c但现在,只要代码存在,AI就能读。Mythos Preview不需要你的代码是开源的,它只需要能接触到代码——不管是源码、还是编译后的二进制、还是运行时的行为轨迹。
' J$ k* P% h3 }* k
8 X2 o# W/ C# ]5 |' W8 v3 b$ C代码越来越难藏了。或者说,代码里的漏洞越来越难藏了。
6 ~) h+ w+ A1 C" [: H2 [# O5 A% x+ M2 p4 y
这是一件好事吗?
7 A4 D9 d! K3 F' P) {4 b/ z/ M1 e+ s5 v
我觉得,短期内,这是一件非常非常好的事。1 }$ X3 A+ s7 }
- t: K( V% h: @( f! i4 U
全球互联网基础设施里,有多少代码是10年、20年、30年前写的?没人敢审计、没人敢动、出了问题就打补丁接着跑的,有多少?
" h& ?' s7 R) x8 x/ G) j0 @
/ G% C0 K6 Y Y: a0 L" p. A这些代码就像一颗颗定时炸弹,埋在整个数字世界的基础里。
& q3 y. F6 Z3 z: @& U4 F( M2 x! g: I3 c
AI能做的是,帮我们把这些炸弹找出来,一颗一颗地拆除。
: \- J. V) n! A) F( _' ^8 U
0 x8 E2 X/ L: b+ ^! |但长期呢?
7 j i6 k. g% k2 k, D
* @" b6 j! U( p! l当所有可见的漏洞都被AI清除干净之后,剩下的,是什么样的世界?
4 u) Y9 ]7 S' }* L+ P5 c# K
9 X2 @+ @( Y/ r) F$ m: R7 F是代码质量极高、安全性极强的一个世界?还是所有攻击者也在用同样的AI,攻击的速度和防守的速度同步提升的一个世界?1 T0 c% D f6 \# d2 x( K( f8 a
! U& {* L* M# g' N+ I4 h
我也不知道。: i1 H6 ?& l3 x+ o# O; v0 P1 Y
, R" e3 @8 K* M0 w' K' n M
但有一件事我特别想强调。# g* X- G, [. y
* ?- A' f2 F6 |, x' w8 ^/ G' U这次Glasswing联盟里,有JPMorganChase,有CrowdStrike,有Palo Alto Networks。这些公司,是真正的安全重度用户。# Q: }0 R* _7 t" i$ N/ ]
$ J! \, q0 f, e他们自己有能力挖漏洞吗?当然有。JPMorganChase的安全团队在全球排前列。CrowdStrike就是做安全的。' b! v" |# x! j8 Q: y+ M! ^' i
% H6 C# D. d1 t
他们为什么还要加入这个联盟,用别人的AI?
. O/ y+ E1 S# h y. e9 b$ c/ c/ Q9 H" Y" z
我大胆猜测一下:因为挖漏洞这件事,规模太大了。. c% g+ P7 q( R
+ ^$ t4 }5 M- [, J' r Z9 r; h
全球代码量太大了。每一家公司,即使安全团队再强,也只能覆盖自己的代码库。但外面的供应链、开源组件、合作伙伴的代码,你根本管不到。
- o1 i, ?) B- G8 M5 H
9 F$ K+ x4 \( R5 I# k' P) VMythos Preview的价值,不在于它比你的安全团队强。而在于它能同时扫所有地方。- p' r% K" C* M0 S# n) P" i
+ k) k, y* y6 R* I
这是规模效应。
7 Q1 F6 d0 u Z2 L+ {+ e/ D2 y: H; a% q9 a0 ^
就像打补丁。手工打补丁,你只能打你知道的那些机器。自动化打补丁,你能打你所有的机器。AI扫漏洞,相当于在每一个代码提交的时候,就自动扫一遍。+ N" F g6 Q! P3 Y2 F! o/ P
* G* `9 v8 s0 z ?& H! ~这个规模,是人类团队根本无法覆盖的。
! _6 _/ A% V: F7 p2 `: U1 N- N2 \ \( }; L9 T h
Glasswing这个项目,还有可能往一个方向发展——成为一个独立的第三方机构。
- Q, B2 V$ P% T5 t# l9 v! F# w& G
什么意思?# p/ |! f V2 p# C9 s, r: C1 W9 K
/ Z2 X) ~, i3 ~, [5 J
现在它还是Anthropic牵头、11家公司参与的联盟。但未来,它可能变成一个真正独立于任何商业公司的安全机构。它的评估结果,有公信力;它的漏洞报告,有权威性;它给出的安全评级,整个行业认。, u- ^8 S: k9 o
+ X" B5 a4 X5 t( ?类似现在的ISO认证,但针对的是代码安全。5 a( Q* h+ u/ [
0 c1 O" u" t4 H& n, I7 n: m1 f; h
想想这个画面。未来的软件采购,合同里可能不只要写"符合SOC2",还要写"通过Glasswing认证,漏洞数为0"。3 R5 E! V, r5 v1 t+ `; k" F
% {) I* t- ]- R% @/ A这不是不可能的。+ \3 l+ x! L! ~
: S5 p% b' Y( ]( d, i当然,路还很长。现在还只是第一步。但方向是对的。6 X& _, C- Z! c) @ ]/ q) A
8 s: V' B+ ^8 g: O+ N0 d好了,写了这么多,让我最后说几句掏心窝的话。: N6 d2 F# w1 s, D& a/ |
" b7 W( B( K# ?+ w5 q) h, c. x/ e! g% ]我这次看到Glasswing的新闻,第一个反应是兴奋,第二个反应是有点怕。* `$ r7 V& [- |0 s0 H
. h Q F+ D0 B2 H$ U! E* R2 @9 A, K兴奋是因为,我真的觉得,这是AI在安全领域做的最有价值的一件事。以前我们聊AI安全,大家想的都是"AI能不能被攻击"——对抗样本、数据投毒、模型劫持。这些很重要,但离普通开发者很远。3 M" x/ U; Z3 z" ^# F
/ P# {, C. r7 [4 p6 r4 W
这次不一样。这次是AI在帮我们发现自己的脆弱点。% F& `$ e" G* j
* `; j2 J4 i: e5 A8 V4 j
这种脆弱点,我们以前不知道,或者知道但没有能力发现。AI把它们挖出来,摆在阳光下,告诉你这里需要修。
: w5 p2 U' ]% J$ a7 @4 X L: }7 d, _2 w
这是AI在补人类的短板。不是在超越人类,是在帮助人类补上人类自己够不到的地方。
; L4 c2 k" o* w: Y& [" a" Z5 \- Y$ F9 B% w
我怕的是什么呢?
" u7 W5 q6 ]- |) Y. p; I0 N
# r: z% c3 E* {: D我怕的是,这个工具,只有大公司用得起。4 Y- _! @* s# G& H! W) c$ b# O
7 [* \7 x( I( i0 xAWS、Google、Microsoft,Bedrock、Vertex AI、Foundry。这些平台,都是商业平台。Cloudflare这种中型公司,可能用起来没问题。但那些真正需要安全检测的——初创公司、开源项目、十几人的小团队——他们能用到吗?
h! T! R1 h7 g: b& O
$ _! e* L. f& R3 q8 d! gAnthropic捐的那1亿美元额度够用多久?分到全世界的开源项目上,每个项目能分到多少?6 c% u. R" |4 k* T* M7 ~; Z
2 I$ ^$ E" C& k) q
这些问题,现在还没有答案。: V' `4 L9 @% K
! R0 V6 F$ v2 ?* U: R但有一点我特别想强调。2 Y3 [" i2 _. @, m. \2 p4 \5 S
6 w2 z% A* X5 ?# J
Glasswing这个项目,让安全这件事,第一次真正有了一种"基础设施"的可能性。4 I, _3 G) s: Z, n p- j u
6 m$ Q8 b- R! m3 F6 [- p以前的安全,是奢侈品。你要么雇得起安全团队,要么买得起企业级扫描工具,要么你就裸奔。
# q. z: Z7 I: C. k
6 t5 E0 B- ]8 }7 AAI改变了这个等式。Mythos Preview能发现那些企业级工具发现不了的漏洞,但它的调用成本,并没有比那些工具贵多少。
4 \# g# _& J4 a, P. b
: E) A/ y' S+ j R- m- V当漏洞挖掘的成本持续下降,当AI扫描变成每一个代码仓库的标配,我们或许真的会迎来一个更安全的互联网。
" x4 z& `8 N, S' h2 F: \" z; ?& e9 V8 U# G) R0 c
这一天什么时候来?我不知道。可能5年,可能10年。$ u: S# k: E5 W% k
2 a- M" ?8 Z5 ^7 ~/ J但Glasswing,让我第一次觉得,这件事不是痴人说梦了。
7 i( u0 L' ~" b+ n c0 O |
评分
-
查看全部评分
|