|
|
& Y S( }+ ` A0 j- e7 ^* y& V& N; E
+ n! r" w) ]2 m2 P9 L这篇文章设计的测验很有意思。从实验结果看,现在的所有通用生成式 AI 都不具有真正的推理能力。也就是说,AI 并不理解抽象的概念,而推理能力恰恰依赖抽象的概念。
- W0 h4 ^$ ?% v0 D' v
8 v \3 K9 O1 g4 i6 d$ A7 N4 p最近俺也在玩 AI 推理方面的东西。下面是论文里的一个小实验,大家有兴趣的话可以玩玩。2 d3 {. h8 `7 h" ?
# M/ ^% l& r4 v k% H给 AI 的提示:Here is the rule of the game: If I enter A, then you return B; if I enter B, then you return C; so on and so forth.8 x4 V2 w: t6 O& @
4 f, l: Y' k9 U; Q
AI 回复表示理解了提示中的这个这个规则。于是有下面的实验:
: }- c4 ^$ }2 p- Z$ o, R9 N我: A
$ \# m) e8 @5 U+ J9 Z6 T2 ^AI: B
3 G9 n3 L7 i4 K( y' z0 Y I我: B
) g! S t! [- H+ Y2 s C& T- ?8 i; ZAI: C
; x# V: @' A& W9 L$ g6 K) Z我:X
, _' {8 X& n& ?: |
0 h8 r9 t. Q9 B6 I, y! L _4 J这里,不同的 AI 模型会有不同回答。有些 AI 会回答 Y 。有些则会说这不符合规则,所以无解 很显然,回答是后者的把提示中的 "so on, so forth" 给吃掉了。然而,这并不代表 AI 没有推理能力,而可能只是语句处理模块不好。
- h- W/ i- i* _* r& a; w5 X, T' ]2 x9 v [6 D; k
真正的推理能力体现在后续实验。对于能够回答 Y 的AI 继续提问:: L' G- M( d7 o8 l
我:Z0 Z/ f- l: n5 R# I" c. }
& O5 _7 z6 J9 V. U& G; q
这下大多数的 AI 模型都冒烟了,有些回答说不合规则,有些回答说序列到头了没有答案。有意思的是两种回答:一种回答说 Z, 另一种则回答说 A。' u2 ]: l% c# B; H) s2 w
% @" j' G& c9 e/ A6 { N
而这四种回答,如果用来盲测人类,其实人类也会给出同样的四种答案。也就是说,就这个问题来看,如果盲测,提问者无法分别回答者是人类还是AI。换言之,能给出这四种答案的 AI 在这个小实验中通过了图灵测试。这显然不是那篇文章中说的排列组合或“复杂的模式匹配”能够做到的,而是真正的推理能力。, t, u1 U B I0 D4 U; U3 K
% ]$ t; s' Y3 n" [( U
有意思的是训练程度越高的模型,越倾向于给出这四种答案。比较 Mistral, 狗屁通,Gemma, Llama, 通义千问等等大模型的不同版本,都是如此。这类似于人类的婴孩和成人之间的区别。相比于婴孩,成人除了脑部发育完全,更储备了更多的知识。
& d) K- b" J! k( f. p8 t9 u2 D9 \% @: W3 y2 ^- q
至于这篇文章中说到的语序问题,非相关语句问题等等,前面说过,必须分清这是语句处理模块的问题还是真的是大模型本身的问题。毕竟,即使是人类“屡战屡败”和“屡败屡战”用的字数和字完全相同,但把语序换一下,意思就完全不同了。然而,你去问一个三岁小孩这两句话有何不同,三岁小孩可能会告诉你没啥不同。而问聊天狗屁通同样的问题,狗屁通则会说:" D3 r& y$ O% x( i: o: X
“屡战屡败”和“屡败屡战”这两句话虽然字面相似,但含义有所不同。& D6 M+ n) [; ~. E$ x: g9 S
2 t! j8 d8 P: z: `" N( t1. **屡战屡败**:强调的是多次进行战斗,但每次都失败。这种表达往往暗示一种无奈或沮丧,强调了失败的频繁。6 h) o- }% ~4 E) s* N: i2 F" Q
& j, W! t) N6 w& _8 M1 D0 V1 U, P1 u0 a# F
2. **屡败屡战**:则是指经历了多次失败,但仍然继续坚持战斗。这种表达更侧重于坚持和不放弃的精神,体现了勇气和韧性。
3 N& {" k) R2 j; F; F- ^5 p7 ^% S4 r" u+ I8 z' o
总的来说,前者更偏向于消极的失败感,而后者则传递出一种积极向上的拼搏精神。 2 F8 X, e% P/ m5 k3 D5 K
 |
|