TA的每日心情 | 开心 2020-4-8 10:45 |
|---|
签到天数: 227 天 [LV.7]分神
|
玻璃之翼降临——Glasswing计划与Claude的Mythos Preview
3 X. U7 [2 Q9 c7 y* N
7 S$ q% o. Z3 I% y" ~4 A4 C; r2 R7 \1 ~" J! i* H: R ]
一个预览版的AI大模型刚刚挖出了一个尘封27年的漏洞,然后11家科技巨头都坐不住了……
# U z" p' |' k2 L o$ ~. i9 M, |4 N
故事是这样的。; o$ C' S: ]7 l# J
9 D4 [0 m# _3 W5 k9 {" m" ~* Z( u我今天看到这个新闻,看完之后愣了好几秒。
2 K# x: k/ b, }7 y% W6 f% c% p# c. ]4 U" Z# B: T
一家叫OpenBSD的公司——做操作系统的,算是安全领域的老前辈——他们有一个漏洞,在代码里躺了整整27年。1998年写进去的,没人发现。
2 N& n( `9 H1 G; [* A, _; l& K4 }# Q2 H' q( ]
结果被一个AI模型给挖出来了。1 T8 U7 j6 S, G) f# V- i4 t
( S+ s; k7 `# U* n5 s# p, Y
这肯定不是那种"我们用AI扫了一下代码库发现了问题"的挖出来。而是那种"这个漏洞藏在最核心的地方,所有传统工具都扫过5百万次,一次都没报过警"的条件下挖出来。
$ ~- y, Z! U' F* T' v
# l% ^7 A2 W9 ^2 a0 I8 A# ]' b8 V然后,这个AI模型,顺手还把FFmpeg里一个16年的漏洞也给挖了。3 U3 Y y5 q4 P
' \* F. d$ h# b6 R
FFmpeg,音视频处理领域最最最核心的基础设施。全世界的视频播放器、浏览器、直播平台,有几个不是建立在FFmpeg之上的?这个漏洞在里面藏了16年。5百万次自动化测试,没一次报过警。: F6 m0 @7 r$ E+ j B( L8 P; B
+ q/ V2 ?2 }) z+ y( c
然后呢?
" j) g+ x& x7 N) x
9 o" \( t1 u# w. H. N( x2 ? C, J然后,11家全球最大的科技公司——Google、Microsoft、Apple、NVIDIA、CrowdStrike、JPMorganChase、Google等等——坐下来,说了一句话:我们一起出钱,让这个AI模型,能被全世界的安全研究员用上。
2 X! p; e( A. U" ~- k+ [
V/ j! [3 m) n9 K9 Z* K# |. l i这个项目,叫Glasswing。; i- o. p4 r& X8 z0 T0 {
/ C% M U3 x/ ]* J) _# Rglasswing
9 p3 J$ |/ B$ ^3 ^% p/ n% f9 D$ L* n1 E3 C
. @9 \6 n! a* R9 M6 y7 g先说清楚Glasswing是什么。
/ L9 ?* X1 F0 P3 U- ~7 Q4 e; P8 Q# T( x" B" G# ]; ?5 @0 j
简单说,它是一个AI安全联盟。发起方是Anthropic,加入方是一堆哪怕是不关注技术领域也叫得出名字的科技巨头。它的核心,是一个叫Claude Mythos Preview的模型——注意是Preview(预览版),就是还没正式发布的那个版本——专门训练来挖漏洞的。( U* z, g5 w2 L" Z& q
' t( a& _0 P/ k d4 l有多强呢?: N7 l' {4 T% P% P% F9 {7 I
( v9 R9 b7 G" H$ L: y; @CyberGym基准测试,83.1%。作为对比,Claude Opus 4.6,得分是66.6%。不是Claude Opus 4.5,是Claude Opus 4.6,Anthropic目前最强模型。
9 y6 n& d+ ~# n
) O6 ]1 g/ B. C. [* _# D7 S, C- USWE-bench Verified,93.9%。还是SWE-bench Verified,不是那个容易一点的版本。Claude Opus 4.6是80.8%。7 \1 r0 R# Q+ e1 |2 h7 V
1 ?" P+ y7 V: L; F; g+ }差了13个百分点。
! ~- X9 Q. C! T* L
& o. T- H& o( l1 T' J; A: \你说这13个百分点意味着什么?6 I- z+ e. r- ^, {/ c* r5 M
/ D7 {; d: |1 O; v, _
意味着,传统扫描工具漏掉的那些最刁钻的漏洞——那些藏在层层调用关系里、藏在异常分支里、藏在并发边界条件里的漏洞——Mythos Preview能找到。9 v! j3 Z+ @' |* z$ R6 e
- Y- i! `' m1 `1 w( k2 T
意味着,27年的OpenBSD,16年的FFmpeg,以后可能不会再有了。
' I' K0 |9 x- |. o B) w
" T' u, K; v/ `/ ^或者说,这种级别的漏洞发现速度,会比以前快几个数量级。
+ T5 u; j8 | t1 W% d& ]
/ r! G' g+ @( W8 j8 [8 e说到这个OpenBSD的漏洞,我必须展开讲一下,因为这个例子太有意思了。! M6 O F% z# L/ A* x/ Y5 ?& U
$ Q2 t& _0 @ V/ G* d
OpenBSD是个什么存在?
/ @' V5 e M4 i5 f+ c7 ~8 ~& h2 d0 P; W8 G9 @, z
它是BSD操作系统的一个分支,最核心的设计哲学就是安全。代码审计之严格,在整个开源社区都是有名的。很多安全研究员的信仰级操作系统。5 j+ q8 c% f8 e; J2 V
6 s. Z! L7 H3 V
这样的项目,代码审计了多少年了?二十多年。# i+ l8 k/ P- X; B' x
! y0 d2 I9 ~/ ~
然后,一个漏洞,在里面躺了27年。/ G1 L7 f! R$ Y
1 u/ Z& F! R8 `# O
这说明什么?
6 B9 B* t" m9 T9 Z: x' V& `, a W: P6 @* Y. l- I
不是OpenBSD的人不行,是传统的审计方式有盲区。任何人工审计,只要时间足够长、人足够累、代码足够复杂,就一定会有漏洞漏过去。这是人性的边界,不是能力的边界。
1 \8 i! j6 D( I1 S
! k! S9 d4 u) [/ l1 W8 o但AI不一样。AI不会累。AI不会因为审了三个月之后注意力下降。AI可以在几个小时之内,把整个代码库的所有调用路径、所有边界条件全部穷举一遍。
7 u) T& [* [% e5 q- u( Z: @5 z! w, D0 W$ u# e4 ? r( e
Mythos Preview发现的那个OpenBSD漏洞,是一个本地权限提升漏洞。攻击者如果已经拿到了一点点访问权限,可以利用这个漏洞进一步提升到root权限。
& k( q/ Y) m4 g) x6 @9 [* S
& H- y2 |0 `! o( {; K# r7 a这种漏洞可怕在哪?3 k: W0 }0 P' W: F7 B7 u
( J0 L4 x: ^; x6 f' b& m它不显眼。它不是那种"输入框里填个单引号就弹shell"的漏洞。它需要你对系统有相当深的理解,才能构造出触发条件。, @2 f* l& O) q- t/ G9 L+ E
- V: X Q/ N5 }2 x
传统扫描工具扫不出来,是因为它的payload模式不在规则库里。AI不一样,AI学的是语义理解,它不是匹配特征,它是理解代码在"想什么"。
/ ?) U! [5 B- `$ u* Z" a
3 \: U* u5 y; ^1 v: DFFmpeg那个例子更让我震撼。
& Z! E+ ]. J2 M0 v, F# f. M
, O9 g" K4 s3 ~' S: ]1 F16年。
' E ^1 @' p6 D3 O V0 A
4 g) M- h: ~* _1 u. |FFmpeg上一次发现这种级别的漏洞是什么时候?2009年。4 m7 ^3 W9 m% ^
1 e, y0 N8 `# P/ c9 y
16年都没有人发现。然后Mythos Preview扫了一下,找到了。! ]2 f: a5 M8 p
2 f% Z1 e5 N. w' M( }9 ?
注意这个"扫了一下"的背景。SWE-bench测试集里,有大量是真实世界里的bug修复历史。FFmpeg这个bug在历史上真实存在过,是某次修复的时候被记录下来的。这意味着,Mythos Preview不仅能做代码审计,它能做的是:从海量代码里,识别出"这个写法有问题,即使目前还没有人报告过"。! G2 V& |5 c( _% \" }
# z3 `8 k, G0 d% d
这是主动防御,不是被动响应。- S6 N0 `' x* H
$ w8 ?) K; M* ^传统安全的方式是:出了事 → 分析样本 → 提取特征 → 更新规则库 → 下次能识别。
9 k* |% v6 o* p! p* C5 z" _4 ]* Y# z% A8 v
AI安全的方式是:不需要样本。直接读代码,告诉你这里有个洞。
7 I, a! v& F* c4 P( v- M% I
' g4 x5 N4 o. _. ?7 F5 h这两者之间的差距,大概就是"等贼来了再装防盗门"和"在盖楼的时候看着图纸就告诉你这堵墙扛不住地震"的差距。8 K: [: z8 K9 t- j6 ~# V, m8 p
) x% a6 }* M/ X" n, p现在说说大家最关心的问题:谁能用到,怎么用,花多少钱。
/ N, U( t6 M R/ P% ~/ |/ J& a* m
0 v9 Y9 S0 ?- tGlasswing的AI能力,现在跑在三个平台上:Amazon Bedrock、Google Vertex AI、Microsoft Foundry。
$ M2 n% O" y4 \6 q9 ^. I6 I1 }8 o1 G! K# C( I
这三个平台,恰好是AWS、Google Cloud、Azure。全球三大云服务商。
0 D) I4 d0 C/ Y0 e' ~- K
5 v, y3 I& [7 m& u) m+ f0 O) Z) D你在任何一个上面,都能调用Mythos Preview的漏洞检测能力。: p* O3 J3 w _4 ]
9 j# K7 n7 ?3 J1 k3 O
价格呢?过了初始的credits之后,每百万token输入25美元,每百万token输出125美元。; u) s, a% u. m: W* W
8 b- k* v) T9 x1 _
这个价格贵不贵?
1 v' ?8 C4 u' V" B1 S9 l$ Y |4 m; R
对比一下就知道了。现在市面上做代码安全扫描的工具,像Snyk、Veracode这一类,商业扫描工具的报价大概是每个开发者每个月几十到几百美元不等。而且它们扫的是规则匹配,不是语义理解。
, \, a" N% Z3 q- {2 q
" ^& R# k$ W/ l# ?" \5 F/ KMythos Preview能发现那些工具发现不了的漏洞。+ R6 g1 j2 [, ^1 o; d
% W0 b2 L. }% ]+ H! D7 H这不是贵不贵的问题了,这是"有没有意识到你以前省的那些钱其实在交更多的学费"的问题。$ i! b6 K. C: E" h5 `. }
1 |1 g( ?% ?8 l. T O* o另外,Anthropic自己掏了1个亿美元的使用额度,分给联盟成员和开源社区。还额外捐了400万,250万给Alpha-Omega/OpenSSF,150万给Apache软件基金会。) h8 B& e- _2 G9 u0 {- a6 i! F
" {3 ], m `9 b3 |
这些钱是用来干什么的?让那些没有商业利益驱动的开源项目,也能用上最好的漏洞检测能力。) V9 ?6 m. n1 M5 n
' }! O/ v/ [5 `. E' }/ h. M6 FFFmpeg就是开源的。OpenBSD也是开源的。这些项目没人给他们钱做安全审计,但他们的代码,运行在全球几十亿台设备上。8 J0 K% j. J) {( ~0 i+ c+ }
" o6 o. T1 I0 d! z% V还有一个细节,我觉得特别有意思。! }9 H, t+ R: E9 D3 G
5 Q' O* ~. c3 y
漏洞发现之后,公开披露的时间是90天。
6 ~0 X* ]% ]8 n! d J- s. N+ v7 b2 A
90天是什么概念?/ |4 `1 \/ b" {8 r9 s
4 |9 {6 e: f$ T# e5 ~行业标准的漏洞披露窗口是90天。这个时间足够让厂商评估漏洞、制定修复方案、推送更新,但又不至于让漏洞在黑市上流通太久。8 g# P: j& j5 k% Z4 f/ n/ b. t! Q
( }$ T0 O" @8 d) t! O$ x
但这里有一个问题:90天是针对"有人发现了漏洞"这个前提来说的。
2 h0 M% _% }$ a; { ^$ ?1 w. n$ ]0 |/ C' ` s& r! _
Mythos Preview现在能以前所未有的速度挖出漏洞。它一天挖出来的漏洞,可能比以前整个安全社区一个月挖的还多。
9 M) B3 K% O7 d3 M: g
9 j- a& R; r8 P |' ]这意味着,漏洞披露的节奏,整个就变了。
2 m# E- q9 v8 m9 w# i' s0 G8 ]' t& \4 ^4 Q" C# P
以前是"挖到一个,披露一个"。现在是"AI在持续不断地挖,每90天披露一批"。
( W6 u! D5 z/ P' S9 G2 a) w5 j/ E2 s/ C& d! V6 r
厂商的补丁开发速度,能不能跟上AI的发现速度?
) V0 |/ y4 L4 a3 i
/ Q, U" r) ^6 \* {) W这个,我说实话,不知道。但我觉得,这是整个Glasswing项目最值得观察的地方之一。' U1 P4 y1 w# n5 W( M
% C1 v" s. @, ^# A; a* D3 q写到这儿,我突然想到了一个更大的问题。
/ i* c) T( k4 ?, ?. c; P1 c$ b: T9 ?- x8 ?0 i1 d- P
Glasswing这个名字,本身就是一只蝴蝶的名字。玻璃翼蝴蝶。它的翅膀是透明的,像玻璃一样。
! u: X: K5 R$ F/ \+ a
# ]. ~+ L. C# A" a" x0 c+ P3 Y5 j透明,意味着隐藏的东西变可见了。
9 r4 s3 k, Y! _ L/ M, C0 E8 k x
一只蝴蝶的翅膀是透明的,它就隐藏不了任何东西了。它在哪里,飞向哪里,所有捕食者都看得清清楚楚。
2 r# ^* C# }3 H1 z% ]" o. i
( \, h% }0 D) w8 b- j8 ^2 w这个意象,放在漏洞挖掘上,太精准了。$ P# S) x% ? F- v4 F7 t
0 X9 S& B, ]& n" S, h代码里那些隐藏了几十年都没人发现的漏洞,在AI的"眼睛"之下,突然就透明了。! [' m: }2 s$ u" i) ~! k
* r7 ~- q7 ]% ]+ K+ Y- d! [以前我们说"security through obscurity"——通过隐藏来保证安全。你的代码不公开,漏洞藏在暗处,攻击者找不到。
2 [+ i* S" q& S+ D$ }8 ?% L w$ ^2 v7 v& W, V0 N' N5 i
但现在,只要代码存在,AI就能读。Mythos Preview不需要你的代码是开源的,它只需要能接触到代码——不管是源码、还是编译后的二进制、还是运行时的行为轨迹。
% v t1 i3 D1 e y* P- B
$ _4 e' K" g+ Q; J9 I; r. R代码越来越难藏了。或者说,代码里的漏洞越来越难藏了。9 n+ c1 {3 o+ i
; P" ~3 ~8 C& j/ ~/ R5 }/ f- K这是一件好事吗?0 E: K( D0 C1 A1 _; U P
: Q# }' b8 T% F l& A: j
我觉得,短期内,这是一件非常非常好的事。; L9 W# H( y8 m1 q- n1 a% o
; p% @3 {$ q# M; g( _全球互联网基础设施里,有多少代码是10年、20年、30年前写的?没人敢审计、没人敢动、出了问题就打补丁接着跑的,有多少?
7 g& t0 n$ C( a: E
% Y; y/ G' E9 h) T9 z这些代码就像一颗颗定时炸弹,埋在整个数字世界的基础里。: ?6 m5 ~! i! `$ ^5 f
7 A: x% N1 _9 e/ eAI能做的是,帮我们把这些炸弹找出来,一颗一颗地拆除。
" j0 U j: v: w& N
7 l9 T. v( Y0 p6 D6 j0 ~但长期呢?
. K: `# h3 Q1 d z. k
* _* c% f( F' a$ n( F) E/ B' x1 @当所有可见的漏洞都被AI清除干净之后,剩下的,是什么样的世界?
! C5 t7 u8 S( s8 {( ~3 B
k: L* r7 A0 H1 r; H( H6 Z) ?. ?; C是代码质量极高、安全性极强的一个世界?还是所有攻击者也在用同样的AI,攻击的速度和防守的速度同步提升的一个世界?
# B6 I$ |7 q( T4 g( L: @! Z/ F: R# L# M O; ~
我也不知道。6 O' z3 Q6 ~& C5 J1 j
* t# u4 l% ~8 m {. n2 J但有一件事我特别想强调。0 W) u2 M* ]$ j8 \3 T& N
0 U1 s8 v. H' k这次Glasswing联盟里,有JPMorganChase,有CrowdStrike,有Palo Alto Networks。这些公司,是真正的安全重度用户。: [. m) T$ o2 J3 X: R2 W6 H
5 R) ]7 e* K; {* R他们自己有能力挖漏洞吗?当然有。JPMorganChase的安全团队在全球排前列。CrowdStrike就是做安全的。2 f! F' Y" g5 q$ x: X
$ W7 p% G$ [- W) M
他们为什么还要加入这个联盟,用别人的AI?, s: x9 n: s4 S. {+ E7 R% K
. n, P8 p$ ]" Q0 n/ i( E; E我大胆猜测一下:因为挖漏洞这件事,规模太大了。
; I y6 p+ d6 e' z9 m" y" X) p' j/ f% a- t& {2 j( v
全球代码量太大了。每一家公司,即使安全团队再强,也只能覆盖自己的代码库。但外面的供应链、开源组件、合作伙伴的代码,你根本管不到。
7 @8 h; h5 c, ?- S1 d& |& A% m0 n! ?4 c, P# h. s& A
Mythos Preview的价值,不在于它比你的安全团队强。而在于它能同时扫所有地方。. n U I {, Q! o8 y
5 ?0 ?$ t2 G c6 `) n# ~9 h
这是规模效应。
: C1 H6 K L* G) z) `) e& g. z% Y+ U- F3 k
就像打补丁。手工打补丁,你只能打你知道的那些机器。自动化打补丁,你能打你所有的机器。AI扫漏洞,相当于在每一个代码提交的时候,就自动扫一遍。) e2 |1 [! u3 k$ W0 g2 e* i2 P
6 k: d* u B$ M1 u) Q7 N+ g这个规模,是人类团队根本无法覆盖的。) V3 X: u; s3 c$ E7 ^; v: { G+ m3 b9 Q
" }4 Y0 t9 f. |! `8 E. d) H
Glasswing这个项目,还有可能往一个方向发展——成为一个独立的第三方机构。
9 p1 |: _8 @" U; F8 c* b
* _. h/ l5 D6 {( D什么意思?7 D: `7 N4 Y' O$ ~
; s& `0 f# h, `2 c; R7 a3 Z现在它还是Anthropic牵头、11家公司参与的联盟。但未来,它可能变成一个真正独立于任何商业公司的安全机构。它的评估结果,有公信力;它的漏洞报告,有权威性;它给出的安全评级,整个行业认。
6 ?5 F5 t; f* `( }1 \/ s K0 p6 J. G7 }- U5 F4 ^5 G
类似现在的ISO认证,但针对的是代码安全。9 x" L" u! k j) C4 j1 y- a
3 W: F+ y, M6 k$ A& r; F
想想这个画面。未来的软件采购,合同里可能不只要写"符合SOC2",还要写"通过Glasswing认证,漏洞数为0"。
7 y1 k5 p N9 W e% A/ {
1 H( ?# g8 P8 Z这不是不可能的。, |, `* ?5 A, w3 y! m
9 L* L6 y! X) D+ F1 H; ]
当然,路还很长。现在还只是第一步。但方向是对的。
5 @2 a: G) z% t4 i4 M8 r" R0 D1 u; r$ l& V% [3 W
好了,写了这么多,让我最后说几句掏心窝的话。
& S& q6 s$ V8 v" |& u/ C/ m0 W4 |) L% v X1 a) Y6 w
我这次看到Glasswing的新闻,第一个反应是兴奋,第二个反应是有点怕。
3 H$ \: ?% A+ V$ U+ B+ T( K" K, Q3 h$ g) @ Y! P) @+ H* r
兴奋是因为,我真的觉得,这是AI在安全领域做的最有价值的一件事。以前我们聊AI安全,大家想的都是"AI能不能被攻击"——对抗样本、数据投毒、模型劫持。这些很重要,但离普通开发者很远。
5 C# K/ ^ N+ b* A1 n) u; R5 [" U, g. N
这次不一样。这次是AI在帮我们发现自己的脆弱点。/ K0 l1 ]1 `$ A
' Z8 p3 {0 s. N, u% y9 u
这种脆弱点,我们以前不知道,或者知道但没有能力发现。AI把它们挖出来,摆在阳光下,告诉你这里需要修。! q' h: w, E2 E' n) I
+ n8 `2 b! ]; N这是AI在补人类的短板。不是在超越人类,是在帮助人类补上人类自己够不到的地方。* b* {& G+ ?- K" q
) m3 R; b5 v4 [- Z- D9 ^
我怕的是什么呢?7 X4 G7 F g0 t; r5 L3 u* L4 p
. d5 y5 ^1 _* \+ O5 L J我怕的是,这个工具,只有大公司用得起。4 m& k9 o& h6 Z
6 G/ m g+ y* g# v0 a+ S" C/ N2 }
AWS、Google、Microsoft,Bedrock、Vertex AI、Foundry。这些平台,都是商业平台。Cloudflare这种中型公司,可能用起来没问题。但那些真正需要安全检测的——初创公司、开源项目、十几人的小团队——他们能用到吗?
' y9 t: \" R6 a: o/ c
3 b+ J/ P6 I& {4 cAnthropic捐的那1亿美元额度够用多久?分到全世界的开源项目上,每个项目能分到多少?, { W9 R3 x5 W5 \" A( G9 u4 X! T
1 _* h) [: M! [
这些问题,现在还没有答案。
. I$ e4 D% {" ?# }6 ]. E @& c8 L; |& d$ l& g
但有一点我特别想强调。
( |7 q$ Q$ _) z: W: n( H* Y/ U. g7 D$ Z2 ?5 G
Glasswing这个项目,让安全这件事,第一次真正有了一种"基础设施"的可能性。6 }! Z4 U; ~8 ?0 C
/ T- `3 |& H5 P
以前的安全,是奢侈品。你要么雇得起安全团队,要么买得起企业级扫描工具,要么你就裸奔。+ U: `( d, s+ H; E2 x7 V' g: D
6 k8 D) L2 v* y# B/ E" p
AI改变了这个等式。Mythos Preview能发现那些企业级工具发现不了的漏洞,但它的调用成本,并没有比那些工具贵多少。
. P K% H9 D" m0 J7 z+ m% ]/ v$ n2 E" o5 l
当漏洞挖掘的成本持续下降,当AI扫描变成每一个代码仓库的标配,我们或许真的会迎来一个更安全的互联网。4 K0 \0 A+ ~$ A0 @9 K& s s4 r4 G
' C* K, a1 o& r/ _" o& B x
这一天什么时候来?我不知道。可能5年,可能10年。
7 |) |# Z1 s2 h( E& R: D0 |1 H) B* g2 c9 w: p4 _- v7 \
但Glasswing,让我第一次觉得,这件事不是痴人说梦了。
1 M/ ?* K. \, H5 W9 S) X |
评分
-
查看全部评分
|