TA的每日心情 | 开心 2020-4-8 10:45 |
|---|
签到天数: 227 天 [LV.7]分神
|
玻璃之翼降临——Glasswing计划与Claude的Mythos Preview
, k- u7 [6 [0 [: s) f% K0 Z9 H' p/ ?" e% i+ [( c% y
, ` T6 d1 \8 p2 i! m: c
一个预览版的AI大模型刚刚挖出了一个尘封27年的漏洞,然后11家科技巨头都坐不住了……4 q$ o: z. W" z
+ C$ \! z$ r3 k) ]* }故事是这样的。
C7 d2 x% v, Y% I4 \( {2 ?( C! K! e* |& f" n! a+ P+ j2 B, u
我今天看到这个新闻,看完之后愣了好几秒。
1 F% [+ o& M/ V9 }/ Z
8 k- Q4 g& K3 b( A _6 N5 L$ C5 h& ~一家叫OpenBSD的公司——做操作系统的,算是安全领域的老前辈——他们有一个漏洞,在代码里躺了整整27年。1998年写进去的,没人发现。
8 k- r, d& z8 J6 t: `) K/ U" R, Y7 ?0 E) [& o+ W6 [+ J
结果被一个AI模型给挖出来了。6 G- [6 O. m2 f1 y1 Y
( R. y" L" J9 L+ Y( x$ f这肯定不是那种"我们用AI扫了一下代码库发现了问题"的挖出来。而是那种"这个漏洞藏在最核心的地方,所有传统工具都扫过5百万次,一次都没报过警"的条件下挖出来。
1 d5 V2 X0 g1 f& u# k0 t- N# c# w# |' N: ?" b
然后,这个AI模型,顺手还把FFmpeg里一个16年的漏洞也给挖了。
& O0 r5 {, y* W2 Q! I# H$ d
3 P4 f; Z( t/ ^FFmpeg,音视频处理领域最最最核心的基础设施。全世界的视频播放器、浏览器、直播平台,有几个不是建立在FFmpeg之上的?这个漏洞在里面藏了16年。5百万次自动化测试,没一次报过警。
! ` Q# M- h+ D1 Y' j9 W+ M9 X: [1 q9 n8 G- a% {# [& B2 y2 l4 C
然后呢?
, a, s- W; y# [/ e" e$ ]5 U! s0 {: Z7 e, q, |, r0 e+ I
然后,11家全球最大的科技公司——Google、Microsoft、Apple、NVIDIA、CrowdStrike、JPMorganChase、Google等等——坐下来,说了一句话:我们一起出钱,让这个AI模型,能被全世界的安全研究员用上。" {- O+ ~1 h1 s3 }
$ ` I6 k4 _+ S, O这个项目,叫Glasswing。
! D% k- W m% d0 Q) z. Y8 i) `) \( w2 a3 o! u4 _4 o
glasswing
: ^! m S' D0 I6 W7 s
4 v q# M# E, @" q! m) F3 N( o% Q& x8 v. F1 \7 M
先说清楚Glasswing是什么。3 t/ D1 T% O6 E& ] A
8 ~* A2 f& D! m; A, K简单说,它是一个AI安全联盟。发起方是Anthropic,加入方是一堆哪怕是不关注技术领域也叫得出名字的科技巨头。它的核心,是一个叫Claude Mythos Preview的模型——注意是Preview(预览版),就是还没正式发布的那个版本——专门训练来挖漏洞的。; v1 I7 I4 e1 ]3 F8 ]! ], t
3 @& B# w; z2 _' g! q g- d有多强呢?9 E# r3 ^% m4 w, ^
" b j; A9 r; q
CyberGym基准测试,83.1%。作为对比,Claude Opus 4.6,得分是66.6%。不是Claude Opus 4.5,是Claude Opus 4.6,Anthropic目前最强模型。
1 p2 ^3 c! S8 G9 ]3 @% T5 s" C. e9 J% v4 v: R. b
SWE-bench Verified,93.9%。还是SWE-bench Verified,不是那个容易一点的版本。Claude Opus 4.6是80.8%。
' f% |4 l1 P$ G7 x0 W# \9 E* A6 `7 w, Y. A3 b9 j
差了13个百分点。
. f3 E# I0 |. T8 o$ J
! p4 m. @2 s" e0 _你说这13个百分点意味着什么?( i" f( T% ^, Q/ q* M' D6 L8 N
# V& f! l" ~) B4 z" h6 c6 a! g1 g
意味着,传统扫描工具漏掉的那些最刁钻的漏洞——那些藏在层层调用关系里、藏在异常分支里、藏在并发边界条件里的漏洞——Mythos Preview能找到。' }( I. }- k% B1 z/ [
7 Z: W+ u7 D H( Y
意味着,27年的OpenBSD,16年的FFmpeg,以后可能不会再有了。! P0 F( I H* V. S" n
8 _% p6 U& R- a1 G
或者说,这种级别的漏洞发现速度,会比以前快几个数量级。' C/ i; N% H' U7 a
2 h6 e. V7 W7 y2 |说到这个OpenBSD的漏洞,我必须展开讲一下,因为这个例子太有意思了。' q+ p5 C% E; f; e7 B4 G# ]$ A
; R$ b8 a: I' A7 X) R7 x; p
OpenBSD是个什么存在?
: k* Z( W* o# k9 H
7 |) t! h* T, ]9 C4 K% n它是BSD操作系统的一个分支,最核心的设计哲学就是安全。代码审计之严格,在整个开源社区都是有名的。很多安全研究员的信仰级操作系统。
3 b6 E: m: D* i4 D7 U. @7 x9 i+ ~) `+ B+ C! C& E) J1 T
这样的项目,代码审计了多少年了?二十多年。, m0 C8 n4 I: P$ q7 H' {: d& p
! [3 _2 c0 }6 y然后,一个漏洞,在里面躺了27年。
0 `8 B3 T$ D- }' k7 ?( I* t1 ~4 W! y
& y' ^$ G1 D& [/ L- R- S这说明什么?
( \ ?- W4 B2 M# G3 E; J: F* u) i, s+ x- Y% U
不是OpenBSD的人不行,是传统的审计方式有盲区。任何人工审计,只要时间足够长、人足够累、代码足够复杂,就一定会有漏洞漏过去。这是人性的边界,不是能力的边界。 v5 K* h, F+ B5 D
! g1 _$ \. m# X/ \# Q' }但AI不一样。AI不会累。AI不会因为审了三个月之后注意力下降。AI可以在几个小时之内,把整个代码库的所有调用路径、所有边界条件全部穷举一遍。
]% J% r4 d& f" k3 w$ d
9 ?0 t) C6 X j3 H' U9 MMythos Preview发现的那个OpenBSD漏洞,是一个本地权限提升漏洞。攻击者如果已经拿到了一点点访问权限,可以利用这个漏洞进一步提升到root权限。! l( N2 I! \' O9 K9 `5 r& {
% }& R. j- {& n
这种漏洞可怕在哪? W2 L% Y8 W7 X5 {( D
: j$ W( i6 n# z5 i
它不显眼。它不是那种"输入框里填个单引号就弹shell"的漏洞。它需要你对系统有相当深的理解,才能构造出触发条件。
; V! D% Z1 J1 E9 O( S
5 f# v3 [$ K: B, E0 u( t8 b传统扫描工具扫不出来,是因为它的payload模式不在规则库里。AI不一样,AI学的是语义理解,它不是匹配特征,它是理解代码在"想什么"。5 M# \+ d M) q! _
% W; Q! U. s& i+ `
FFmpeg那个例子更让我震撼。, {4 t; [1 R5 H! J
' J4 p$ b; V) b" ^% q9 i16年。
" y& l2 S! W- x! R" o: s
# U: y, ~; g7 B6 i# U! w+ oFFmpeg上一次发现这种级别的漏洞是什么时候?2009年。0 h( ~4 r) ^) ^& n. E
; ^4 |2 k! }: ^5 ^+ W+ y& B+ f
16年都没有人发现。然后Mythos Preview扫了一下,找到了。
1 t- A6 x$ i$ W" s5 p8 W& f( g' H" N4 \1 h+ R5 {1 y6 A. v
注意这个"扫了一下"的背景。SWE-bench测试集里,有大量是真实世界里的bug修复历史。FFmpeg这个bug在历史上真实存在过,是某次修复的时候被记录下来的。这意味着,Mythos Preview不仅能做代码审计,它能做的是:从海量代码里,识别出"这个写法有问题,即使目前还没有人报告过"。
$ h" B ~/ O* |6 ~/ z0 `; Z
4 x$ C9 Q! m, I, n- p) ~( ?; U这是主动防御,不是被动响应。
% P" H% L" d3 @
6 y: F$ n: g5 e传统安全的方式是:出了事 → 分析样本 → 提取特征 → 更新规则库 → 下次能识别。, G! _( j+ d; ]
$ U2 H2 C2 h. r7 d- G# g
AI安全的方式是:不需要样本。直接读代码,告诉你这里有个洞。3 Q" R& n+ D3 a, a
# u* I: _6 p- V* u" f) V
这两者之间的差距,大概就是"等贼来了再装防盗门"和"在盖楼的时候看着图纸就告诉你这堵墙扛不住地震"的差距。
" i, h/ v5 Q0 }) R$ V& f2 b% ]. K7 P A- N
现在说说大家最关心的问题:谁能用到,怎么用,花多少钱。9 z2 n, P$ s) W& `9 \
2 C3 d9 @; Q+ j. d3 p) T, [6 iGlasswing的AI能力,现在跑在三个平台上:Amazon Bedrock、Google Vertex AI、Microsoft Foundry。
! U8 y1 m: v& s, O
7 A) y, F+ ~+ f9 N( c" n ?0 V这三个平台,恰好是AWS、Google Cloud、Azure。全球三大云服务商。" x0 L2 d. E& R& X6 ?7 G$ H
! v9 g: m& h7 z2 O+ m% |你在任何一个上面,都能调用Mythos Preview的漏洞检测能力。9 h2 d. z( E6 F$ Z% F& h# J5 X
3 ?& B' H1 }% |" X; g
价格呢?过了初始的credits之后,每百万token输入25美元,每百万token输出125美元。
) f$ i$ ]& _1 I. W5 T, e! R3 n/ U. j6 d. L4 |* k
这个价格贵不贵?
1 i% W" e8 J2 Z' M2 R; q
/ z8 G/ b0 b; m) i/ ~" n1 P, R对比一下就知道了。现在市面上做代码安全扫描的工具,像Snyk、Veracode这一类,商业扫描工具的报价大概是每个开发者每个月几十到几百美元不等。而且它们扫的是规则匹配,不是语义理解。
. g1 W K' ]: u8 m$ z$ k8 ?: w% q# n: ], N# `/ K
Mythos Preview能发现那些工具发现不了的漏洞。
* L, Q# [; C, n6 @5 M) k m a! i' b
这不是贵不贵的问题了,这是"有没有意识到你以前省的那些钱其实在交更多的学费"的问题。- P7 N( ?4 E: h. F
7 J+ J' N4 }( P/ W0 _另外,Anthropic自己掏了1个亿美元的使用额度,分给联盟成员和开源社区。还额外捐了400万,250万给Alpha-Omega/OpenSSF,150万给Apache软件基金会。4 k0 `6 X9 p# T* _& {: @; j
' H( K y; C, T; [0 Z8 u
这些钱是用来干什么的?让那些没有商业利益驱动的开源项目,也能用上最好的漏洞检测能力。3 |$ h" H, C6 f
6 C) [% N! n" IFFmpeg就是开源的。OpenBSD也是开源的。这些项目没人给他们钱做安全审计,但他们的代码,运行在全球几十亿台设备上。
4 O6 e* K0 u8 m) N3 v) z- R% i8 e, c, B0 K
还有一个细节,我觉得特别有意思。
: V# _0 A9 K3 } A
" D& W6 n7 D1 M漏洞发现之后,公开披露的时间是90天。
/ U% c) u, K4 W! A/ n/ ^* b6 e2 h+ z2 V' f8 |
90天是什么概念?
- V- s) i8 u8 W" f4 o; G2 L" n
+ W0 x8 G9 b5 R, h行业标准的漏洞披露窗口是90天。这个时间足够让厂商评估漏洞、制定修复方案、推送更新,但又不至于让漏洞在黑市上流通太久。, p. c* \( P- }) I5 r" _7 e
) ~1 S+ x1 B7 U$ h但这里有一个问题:90天是针对"有人发现了漏洞"这个前提来说的。0 A, [# f( Z2 R, t
* q) U, S z: _( l2 G2 u! {
Mythos Preview现在能以前所未有的速度挖出漏洞。它一天挖出来的漏洞,可能比以前整个安全社区一个月挖的还多。
( B& {, ]1 `4 k) o
# u9 t) u; Y# u" T5 e7 @) H5 i这意味着,漏洞披露的节奏,整个就变了。
* s" u t4 \/ D; L7 C t8 ]* V
+ x4 K' h' v3 O D u6 J. s# {以前是"挖到一个,披露一个"。现在是"AI在持续不断地挖,每90天披露一批"。4 @# l' I7 `( ^
" p+ r, M4 H1 v+ G
厂商的补丁开发速度,能不能跟上AI的发现速度?2 P+ K; D% t! Y3 d# S4 A9 r; B
: `7 n x+ R( T" f0 A这个,我说实话,不知道。但我觉得,这是整个Glasswing项目最值得观察的地方之一。# J7 ^ Z' }+ [+ E- I5 p0 b4 K
( r2 r- q' M( {+ g5 O
写到这儿,我突然想到了一个更大的问题。/ w6 u: j5 B8 l/ C1 `: ^# F
3 n9 Q5 ?' ]* bGlasswing这个名字,本身就是一只蝴蝶的名字。玻璃翼蝴蝶。它的翅膀是透明的,像玻璃一样。: H0 ]! R1 V& ^8 y) J$ k5 L
! X4 I }$ B# U8 {4 w8 q
透明,意味着隐藏的东西变可见了。( g" S) T' L. i1 ]% G
$ |6 @1 u$ o) I& }. U2 u" f2 U( w
一只蝴蝶的翅膀是透明的,它就隐藏不了任何东西了。它在哪里,飞向哪里,所有捕食者都看得清清楚楚。4 J& X2 H) W& U d: G1 \! r; N9 c
: v7 ?2 k1 b' P
这个意象,放在漏洞挖掘上,太精准了。# O. V+ i$ J' s7 I% i1 Y( T
6 G: O% C+ h. G* K3 X6 T: a
代码里那些隐藏了几十年都没人发现的漏洞,在AI的"眼睛"之下,突然就透明了。
4 Q/ J$ o( B1 w4 x, A u% R( [, P' s% X
以前我们说"security through obscurity"——通过隐藏来保证安全。你的代码不公开,漏洞藏在暗处,攻击者找不到。
. O, H4 e" j. e2 Q6 r4 m6 Q% C. ]' v$ Q+ g/ ^1 e2 `9 Y
但现在,只要代码存在,AI就能读。Mythos Preview不需要你的代码是开源的,它只需要能接触到代码——不管是源码、还是编译后的二进制、还是运行时的行为轨迹。
1 y9 {1 T$ d' t% o' u+ U5 C w2 ]( S3 W* `& b( }& P) h
代码越来越难藏了。或者说,代码里的漏洞越来越难藏了。, {- A) e; f( @0 j" ~! b$ L& b
; G5 k, p3 F5 l7 W* A6 N3 R这是一件好事吗?
! B2 j2 x1 L- @% Y
K! B! k# m$ Q/ ]+ o我觉得,短期内,这是一件非常非常好的事。
) A3 G4 ]. Q! P% a
& [; [& U5 V. S- ]) z% t全球互联网基础设施里,有多少代码是10年、20年、30年前写的?没人敢审计、没人敢动、出了问题就打补丁接着跑的,有多少?
5 _# m7 b) @9 `/ t7 l. t7 L _- d
这些代码就像一颗颗定时炸弹,埋在整个数字世界的基础里。
. U5 v: r ^8 u' @5 u" k, _
& u4 S- c# V) K: B0 J- j. yAI能做的是,帮我们把这些炸弹找出来,一颗一颗地拆除。. S( y6 ^- v5 ?7 e! |' ]4 a& m' V
+ S! `; L" M7 D$ Y1 a
但长期呢?/ u" _" c' V6 e! U& e' b) ]1 s- k- g
- m# N4 i6 }" D6 w* L. w& v8 J3 P当所有可见的漏洞都被AI清除干净之后,剩下的,是什么样的世界?
) q$ Z1 k% Y$ W' \) D6 S) Z
. Y* P+ c I! t是代码质量极高、安全性极强的一个世界?还是所有攻击者也在用同样的AI,攻击的速度和防守的速度同步提升的一个世界?* O6 o9 k9 N# |( ]2 k. J" c
; w# m& ~: l4 f& T2 |
我也不知道。
. i* H. x" ^& `0 x" |1 u8 }; `8 \2 V
: F9 s: P7 T5 E& E* f但有一件事我特别想强调。
+ l8 E7 l7 K, x+ C; M1 Q4 d" b$ Y. g, \8 H! O; @
这次Glasswing联盟里,有JPMorganChase,有CrowdStrike,有Palo Alto Networks。这些公司,是真正的安全重度用户。- |6 B% ^/ R& q; x- M8 [4 Q
3 _0 k( j& u) l! x: f) B' Y他们自己有能力挖漏洞吗?当然有。JPMorganChase的安全团队在全球排前列。CrowdStrike就是做安全的。) m! J# ?- i" Y' {- k$ j) P
; ^& q8 K6 |5 t1 t2 N: ^/ {
他们为什么还要加入这个联盟,用别人的AI?- M3 D/ ^0 `! n, C
p9 d; F# |1 E+ @: T8 k. y$ J( c我大胆猜测一下:因为挖漏洞这件事,规模太大了。/ Q% T8 h4 g3 q) m9 t
5 m6 d' l& O# b6 v7 s9 u+ R全球代码量太大了。每一家公司,即使安全团队再强,也只能覆盖自己的代码库。但外面的供应链、开源组件、合作伙伴的代码,你根本管不到。
1 m( d) Y+ i i
- V% ~( k' V. p' z9 Q u! KMythos Preview的价值,不在于它比你的安全团队强。而在于它能同时扫所有地方。
; T/ N d) e: M( m
; \+ `5 N# D% j% _; p这是规模效应。; }- S. h2 q, d: r9 C
8 l/ A+ j7 m2 {9 ~3 M: V
就像打补丁。手工打补丁,你只能打你知道的那些机器。自动化打补丁,你能打你所有的机器。AI扫漏洞,相当于在每一个代码提交的时候,就自动扫一遍。/ s+ O* Z. E1 o+ O9 m
: A' R. Q0 i$ O这个规模,是人类团队根本无法覆盖的。
" z& A) H+ K$ ]0 N/ P1 b# m' ~1 Y5 T$ |5 }
Glasswing这个项目,还有可能往一个方向发展——成为一个独立的第三方机构。1 ~7 E9 o" G: p: h, p
8 M4 J+ Q+ u3 b) F什么意思?/ y z" ?# G ]
/ Q# e# J6 i! u7 n
现在它还是Anthropic牵头、11家公司参与的联盟。但未来,它可能变成一个真正独立于任何商业公司的安全机构。它的评估结果,有公信力;它的漏洞报告,有权威性;它给出的安全评级,整个行业认。
( Z4 ~: q% }7 ^1 J% h/ J. h
- b9 \6 o% l# `; |* j类似现在的ISO认证,但针对的是代码安全。
1 I9 i2 h& _4 o! c( P& _6 ?1 `1 j3 k! G( k3 g! \( B' z
想想这个画面。未来的软件采购,合同里可能不只要写"符合SOC2",还要写"通过Glasswing认证,漏洞数为0"。
, D9 C0 }. j1 U$ H; W9 R9 B
2 W5 u8 S& H, M' i这不是不可能的。
0 I/ D6 {4 Q8 ?" @" [6 _- _6 x' X
当然,路还很长。现在还只是第一步。但方向是对的。
1 }% u# f$ e! |5 c% F
9 B6 c% s4 H8 l- J好了,写了这么多,让我最后说几句掏心窝的话。
$ w# ?& ? u4 p/ w0 z
( C y* t- X0 e# Y k我这次看到Glasswing的新闻,第一个反应是兴奋,第二个反应是有点怕。
& o8 l7 z% Q, ?4 V7 W" o6 e3 u* E8 S, h
兴奋是因为,我真的觉得,这是AI在安全领域做的最有价值的一件事。以前我们聊AI安全,大家想的都是"AI能不能被攻击"——对抗样本、数据投毒、模型劫持。这些很重要,但离普通开发者很远。
7 [5 b9 [% H2 c; }( D" p
) Y) x) l+ C5 T8 ?7 i3 e5 m这次不一样。这次是AI在帮我们发现自己的脆弱点。
$ b* j1 @% Q( R+ @* |9 W1 A# r: G% ~/ z6 B* {
这种脆弱点,我们以前不知道,或者知道但没有能力发现。AI把它们挖出来,摆在阳光下,告诉你这里需要修。
. T( B2 v& e6 U! A& E( i8 R( R S2 i8 M! o& m) s
这是AI在补人类的短板。不是在超越人类,是在帮助人类补上人类自己够不到的地方。
# e: d/ i% [" \" m; p" A9 q
( Y7 G6 `& l4 d6 k$ X9 o& G9 y我怕的是什么呢?, ]" F5 X: ` _9 b
7 B' n1 H z5 [& r我怕的是,这个工具,只有大公司用得起。
, N9 B3 e4 @* |* T( L3 J
/ w- h7 K' w( K. O) U8 Z, TAWS、Google、Microsoft,Bedrock、Vertex AI、Foundry。这些平台,都是商业平台。Cloudflare这种中型公司,可能用起来没问题。但那些真正需要安全检测的——初创公司、开源项目、十几人的小团队——他们能用到吗?* Q) i' p6 S9 k' j- m1 ~' d$ D
% h+ ~7 e+ |/ r" p x$ Y4 O
Anthropic捐的那1亿美元额度够用多久?分到全世界的开源项目上,每个项目能分到多少?
y2 J. g9 a. x+ p$ L9 |
0 _6 g% W- L4 h& Z# y7 U这些问题,现在还没有答案。
" ] E9 P( z4 w0 [! D, I5 Y. P. R7 j- d3 O, R# X8 V
但有一点我特别想强调。+ Q0 T$ a h( j0 M0 ?
w' g+ }) a$ O! x7 ^
Glasswing这个项目,让安全这件事,第一次真正有了一种"基础设施"的可能性。
2 u2 a% Z/ k- ^) [7 t& A
" b j k2 j! U8 T以前的安全,是奢侈品。你要么雇得起安全团队,要么买得起企业级扫描工具,要么你就裸奔。
) d3 T" b5 N. l8 Z: i: d7 J. p+ T- V5 ^) O6 f
AI改变了这个等式。Mythos Preview能发现那些企业级工具发现不了的漏洞,但它的调用成本,并没有比那些工具贵多少。
9 n8 x# r* _+ \5 k6 T g* b
1 l4 L8 ?* C5 q |2 R. T' ^当漏洞挖掘的成本持续下降,当AI扫描变成每一个代码仓库的标配,我们或许真的会迎来一个更安全的互联网。/ a9 y; d- \: Y3 [
5 k! H9 \6 R; {9 M K
这一天什么时候来?我不知道。可能5年,可能10年。$ X% @) Q6 U+ M" g$ ^" W
6 S6 C1 ~; J; B- ]! u! R, R$ K
但Glasswing,让我第一次觉得,这件事不是痴人说梦了。6 e; w( f% W. ]
|
评分
-
查看全部评分
|