爱吱声

标题: 附议xiejin77兄:大模型加海量数据只是超级刷题大师 [打印本页]

作者: 晨枫    时间: 2024-10-17 12:15
标题: 附议xiejin77兄:大模型加海量数据只是超级刷题大师
多谢xiejin77兄好文(http://www.aswetalk.net/bbs/foru ... read&tid=160739)。想了一下,有点感想,请不吝赐教。. e% a% D# S& u1 U* C# l/ j
) E3 R8 H7 K$ Y5 p. x9 H' K( Q
个人认为,大模型没有奥秘,还是靠模型参数之多来更好地“捕捉”现有知识的量变,而不是产生智慧的质变。知识依然来自海量的数据,也就是人类世界的现有认知。) d3 h, n* r0 d
+ E+ e. I3 v! @- C, S
大模型加海量数据依然在本质上是超级刷题大师。比“查表”式的直接找答案要高级,能填补现有数据之间的空隙,但不能跳出现有数据所代表的知识的框架。在本质上,刷题能解决的,大模型最终都能解决。刷题解决不了的,大模型最终也解决不了。刷题也不是直接照搬解题,还是要判别题型不是嘛。& [2 @( O5 ^* h* x& v- r* A
2 j- S: p) @5 |& j
世界上的“题”已经够多,所以海量刷题是能刷到很恐怖的“智能水平”的。但依然只是超级刷题大师。沿着这条路走下去,不可能走出创造智慧、具有独立判断的“强人工智能”的。大模型“有创造力”的印象来自吟诗作画,但不是还有“熟读唐诗三百首,不会写诗也会诌”吗?画画也是一个意思,只是从文字介质换成图像介质。
$ c9 d* o+ U, s7 P# E
2 z" r3 j" F. z- O; s- N) y用围棋规则自我训练是另一个问题。那是有限空间里确定解的问题,是极大规模的最优化问题。在本质上,这与“深蓝”早年打败卡斯帕罗夫相似,只是算力极大提高了,算法极大改进了。
% U  s6 R9 k8 P; V( M1 z3 l
' Q+ `0 _% T- i  [- i' f/ H+ n这对中美的AI大赛意味着什么呢?
5 y! L) U7 D7 g: ?! I
0 i( e. E6 o7 c- _AI的最终用武之地是在应用,应用型的AI的厉害来自数据,实践才出数据。; K  x( K6 Z4 ?, F& m$ s
- N3 J$ q* K5 a0 J6 r: ~
在军事、艺术这些方面,美国有足够的实践,美国AI会很厉害,可能超过中国。必须说,中国军队打仗没有美国多,中国影视没有好莱坞能折腾,音乐、美术等也是一样。+ O  x: w: v; P  x

9 f6 l0 O& q. {- V* P0 ~% D# z但中国人在制造、建设、物流这些实体方面的实践更多,数据丰富得多。社交媒体和广义通信方面,抖音、微信出现在中国也不是偶然的。个人认为,这些与经济和社会相关的AI应用可能中国会领先,如果不是已经领先的话。
: `0 R5 d7 P7 Q* |6 T6 L& S7 F1 [+ o. e  W
美国式AI训练凭借算力和算法优势,把天下所有圣贤书、垃圾书统统海灌进去,希望“良币最终压倒劣币”,也因为搞AI建模的人没有能力筛选圣贤书、垃圾书。他们需要的是“通用人工智能”,而没人是能在所有方面都成为专家的。2 E' L: d6 y. E. g

& l* a* h$ U7 M中国式AI训练在算力方面吃亏,算法再厉害也输在起跑线上。但中国人有有用的专业知识积累,中国AI也聚焦专业AI,专家参加训练,所以大模型训练时只灌圣贤书,不灌垃圾书,最后在形成有用但专业AI应用方面成绩斐然。
; H; u6 d; S6 V; C7 {5 u" c9 g6 ^7 p! M0 [- z/ `9 }" H  q
最终,算法、芯片这些都不足以决定性地改变中美AI的走势。
作者: 宝特勤    时间: 2024-10-17 20:29
回晨大牛的话。' ]( k2 w5 ?  F) P+ M. _+ U% j  H
2 v7 n. Q. Y+ v; m
我确知美国至少有一家公司是鉴别反向信息的。他们负责AI的是我的密友。8 b) O0 I, l3 X* _

) _7 H4 Y; d  o我下面引用他们的话。我先声明我不同意他们的话。4 f+ I: |8 W' ?2 |# p# p
' R, R0 Y( {% x: @& Q" \1 f
他们的反向信息是中文网络材料。作为唯利是图的美国商人他们对政治不感兴趣。他们这么做的理由是中文网络充满逻辑错误和事实错误。
. `! K% Y! L* j0 `1 f  c- V# U; ]
. A/ O  C/ X% O" B2 m+ n2 H5 O逻辑错误和事实错误是不可避免的。但是多了不好。咱从自己做起,用事实证明他们走了弯路。
作者: 赫然    时间: 2024-10-17 23:16
宝特勤 发表于 2024-10-17 07:29
( Y4 l* r6 U4 N; u# L" ]回晨大牛的话。
7 ~# @5 O# D  Q" r) y# }6 B. ?, U
+ z1 n. F8 j' o! p: H% e我确知美国至少有一家公司是鉴别反向信息的。他们负责AI的是我的密友。
# `/ N, O- d+ S! Z& V. F, q
咋感觉你的朋友在缘木求鱼呢。7 G! r$ d, L; a
众所周知,中文网络的信息量相当小,宽度和深度都不行。这个在几年前就有广泛的讨论。过去几年某种程度上更加是倒退的。掌握中文信息最多是中国政府,第二是国内那些互联网大厂。所以,你的朋友在中文互联网上找内容,感觉完全是门外汉的做法。. E7 A  V1 G0 f( J. O

; B: V9 d& o5 t% M这种封闭带来了信息垄断。其好处显然被美国互联网大厂也看到了。于是,过去几年里信息越来越闭塞,爬虫能去的地方也越来越少了,大量信息开始从英文互联网上消失了。这个其实成为堵塞AI后发企业的秘籍。这点上,感觉美帝在向中国学习了。8 p* g3 I) E9 }2 u

作者: 宝特勤    时间: 2024-10-17 23:29
赫然 发表于 2024-10-17 23:16
) Z1 R2 p/ g8 k咋感觉你的朋友在缘木求鱼呢。6 o$ I$ o+ `6 B/ v3 Z
众所周知,中文网络的信息量相当小,宽度和深度都不行。这个在几年 ...

, f1 Y8 z% Q* v" e7 T% I赫大说得对啊。我朋友不是在中文网上找学习的内容,而是找反面教材。和赫大的观察是一致的。
作者: 征久仁    时间: 2024-10-17 23:30
宝特勤 发表于 2024-10-17 20:29
( h+ M- Q5 ?7 E4 z. g7 j回晨大牛的话。
3 B5 a+ }# g8 [0 M1 b$ J. u. e, ?# y
我确知美国至少有一家公司是鉴别反向信息的。他们负责AI的是我的密友。

& t6 v2 _8 M8 E9 T8 d以我大美利坚为例,Truth Social , X, Reddit和TikTok 同主流媒体的区别,让我有了一种平行时空的感觉。
! J$ v4 H1 r1 F  W, ?. M: L6 ], Y4 }$ A1 P& K; ]
回到中国,小红书抖音快手,知乎网易豆瓣,同官媒,也肯定不在一个层面上。$ E, p: @% Q) G( L" U$ Z
/ _: P: @2 Y* U- l& \( [
所以逻辑错误或者认知完全不一样都很正常,不宜轻易下结论。
作者: 征久仁    时间: 2024-10-17 23:32
AI在总结现有数据上先天性强于人类,但将AI用于开拓新领域必须小心求证。+ m$ N: A0 Z( }1 N9 h
( y8 E; @5 s  x' M% y% Z! Z! b7 W5 y& ^
我天天用ChatGPT改邮件和论文,但我不相信ChatGPT写的论文。
作者: 晨枫    时间: 2024-10-17 23:39
征久仁 发表于 2024-10-17 09:32
* C7 v/ e. g$ T9 q- U+ b- U; kAI在总结现有数据上先天性强于人类,但将AI用于开拓新领域必须小心求证。+ }- r& d& `( S" ~
  V" g; S6 m; S9 L8 ]1 b& g
我天天用ChatGPT改邮件和论文, ...
3 E" h5 D5 C: q" w8 Y; N$ d. r" `
AI总结现有数据能力超过人类是自然的,就像雷达、光电红外的“视觉态势感知”好于人类一样。AI的输入通道比人类多太多了,运算速度也爆棚,要刷题,人类是不能拼得过AI的。谁要是无聊到开动AI狂写诗,乾隆都要羞愧。但事实还是一样的:乾隆不是真诗人,AI也不是真诗人。
作者: 赫然    时间: 2024-10-17 23:47
晨枫 发表于 2024-10-17 10:39
0 I7 a9 S+ M: A, D9 d1 b  U9 f4 zAI总结现有数据能力超过人类是自然的,就像雷达、光电红外的“视觉态势感知”好于人类一样。AI的输入通道 ...
0 a9 r& f- r0 C) X4 {7 `
感觉AI遇到理论瓶颈了。。。辛顿老先生害怕的超过人类的AI看来暂时还没有影子呢。
/ Z. i, _5 c3 {/ n2 j# m2 a. \! L% |8 V; G9 g; m2 x
好在AI现在还在进步,等几年看看最后能落地什么。
作者: yanei    时间: 2024-10-18 01:24
宝特勤 发表于 2024-10-17 20:29. x1 U3 L. m( h- r- J
回晨大牛的话。
$ y8 O. i! \9 D# x( K# S
# P6 ^% W1 E% _  V% I, x2 Z我确知美国至少有一家公司是鉴别反向信息的。他们负责AI的是我的密友。

! b& P9 h: p; F, c行啊,他们高兴就好。再说他们软件能读得懂多少有高中大学水平的中文?
作者: dopplermaxgamil    时间: 2024-10-18 02:02
宝特勤 发表于 2024-10-17 20:291 j: z  e( t2 G8 X0 f' }: X
回晨大牛的话。
( {# Q! w' y+ X* q& Z5 c+ q1 B. s! D* g
我确知美国至少有一家公司是鉴别反向信息的。他们负责AI的是我的密友。
1 ~" W* y$ Y2 u  _
不知道你出于什么动机不停的阴阳攻击楼主,也许楼主在别处的罪过你?
/ O# X7 M1 Y$ j5 z一个整天自诩大公司高管的ID,不停在每个楼里秀你的小肚鸡肠,说怪话,整得像个怨妇似的。
* g% F) p# D% Q. y" t
( j' q6 d7 e0 v+ s$ c& w- M/ |劝你呀,还是集中精力cosplay忙总,深度创作傻白甜的职场小作文。那才是蓝海的网络赛道呢。2 R; s( v1 p5 h/ f' ^
% A8 D  k  O+ r, `7 S" K1 P
你在西西河cosplay忙总,用力过猛,已经被扒的裤衩都不剩了。又跑到爱坛碰瓷晨枫,好不容易积累了一点人设,这么快就要败光了,何苦呢!
作者: 宝特勤    时间: 2024-10-18 02:04
yanei 发表于 2024-10-18 01:24
* i9 m7 u: ?% X; u( P% h& U行啊,他们高兴就好。再说他们软件能读得懂多少有高中大学水平的中文? ...
; \: I9 D4 S: r* h+ h8 ]) E
回yanei 坛友的话。他们软件有中国大学内容啊。我随便问了一下 ChatGPT.8 ^: j0 Z) n2 I' C

/ T( ]4 j, R& _3 U! e- A
作者: 征久仁    时间: 2024-10-18 02:38
晨枫 发表于 2024-10-17 23:39
1 s6 Z1 X; `0 C' z6 EAI总结现有数据能力超过人类是自然的,就像雷达、光电红外的“视觉态势感知”好于人类一样。AI的输入通道 ...
% e( [( l$ p( L( U
最后一句绝杀了,太牛了
作者: 孟词宗    时间: 2024-10-18 04:13
征久仁 发表于 2024-10-18 02:38
1 q7 |+ j5 p3 W8 ~) t最后一句绝杀了,太牛了
3 r% q& u* ~' |9 s3 j
乾隆也是真诗人,首先是真人,其次会作诗,做的水平如何不提,但起码都合格律,就是写得有点多。基本每天一首,总量相当于《全唐诗》共四万三千多首,强烈怀疑他是带着 AI 穿越的。
+ s6 r9 E7 P3 U) O7 E; s
' B1 X% \8 a, H6 Y2 _: J" o3 L( A8 f乾隆诗作虽然总体水平不高,但也不乏上品的,毕竟量变还是会带来一点质变的。例如:4 K- a. {& l0 C8 t# L7 V$ o( Q

0 r7 J2 }. E  ~谁氏园林择胜开,山环抱复水瀠洄。
* \5 ^; r  o7 j, d; }5 k6 ?1 k川横桥喜路不断,岸转船如峰自回。. e6 q. x5 U( W* \# H  D
意入敞亭趣有永,目游高阁望无埃。# O( T, H/ f6 x4 e
分明层叠浅深处,欲问丹青能是哉?2 b& {5 a% x3 O6 X, E8 [

* ^4 B7 `: ?! N8 {5 j还有这首:- S0 u8 }3 m( e/ R
三秋别忽尔,一晌奠酸然。. l( [! L' b2 L! m
追忆居中阃,深宜称孝贤。
, U" [" K  O1 p0 j1 x* E平生难尽述,百岁妄希延。1 V1 `2 |) c& @5 g2 z; Q
夏日冬之夜,远期只廿年。
/ j0 M3 [" N# d7 i% ~+ c( E7 R9 N1 Z3 S+ a: G
这是乾隆思念亡妻所作,平铺直叙,但情深意切。如果把赋也作为散文体的诗来看的化,乾隆的《述悲赋》也是很好的。
作者: xiejin77    时间: 2024-10-18 11:01
感谢晨大翻牌子。
, a5 a1 @2 N9 a. i
6 w9 ~" L! M( a0 f我是金融科技从业者,大模型领域的进化不得不长时间的持续跟进,同时也不得不面对非技术背景的人的询问。甚至是有些德高望重的前辈。$ ]1 \  {0 j+ }+ Z1 ]9 m3 k+ Y$ D% ?

4 f% y" A, v, I; _AI这个领域的发展,虽然常有一些意外,但还是跳不出唯物辩证法认识世界的基本观点。: V& T: F% J& M5 R  m( G9 Y  [3 ]
$ k/ M) y: W: W9 N' I/ b
晨大的论断,很有一点战略的味道。其实教员同志当年的实践论,矛盾论都是可以拿来理解这些现象的利器。但是国内没有这样的舆论来讲这些话。领域内的只想搞大新闻或者闷声发大财,也米有一个权威来讲讲这些战略上的东西,而用官话套话说这些又显得格格不入。8 k: t" v: }) ~% L8 W) v
. w4 j  r- V7 g7 f
所以,舆论的阵地,如果我们不占领,就会被人占领。
作者: xiejin77    时间: 2024-10-18 11:03
孟词宗 发表于 2024-10-18 04:13* Z9 p! L0 \5 h5 d3 h/ j
乾隆也是真诗人,首先是真人,其次会作诗,做的水平如何不提,但起码都合格律,就是写得有点多。基本每天 ...
4 R* J3 ~- F/ R% B  v1 h7 `, H
孟老师可以移步诗梦小轩,看看俺的这篇解读http://www.aswetalk.net/bbs/foru ... read&tid=160605
$ ~1 t1 U! A2 z1 ?* a: P7 E1 i7 M# ~$ t9 a( {2 A  r; Z
作为一个长期有写近体诗习惯的入门者,俺对于AI的近体诗还是有一些体会的。
作者: 征久仁    时间: 2024-10-18 21:22
孟词宗 发表于 2024-10-18 04:13
. g  B% ^$ y2 R: f乾隆也是真诗人,首先是真人,其次会作诗,做的水平如何不提,但起码都合格律,就是写得有点多。基本每天 ...
8 D5 x% a) I( t# t
很多字我不认识
作者: 潜水员    时间: 2024-10-19 00:01
做中文专家AI系统确实是个好主意。通用AI如果是基于中文互联网确实太难了,污染得太厉害,到处是海量重复和不加甄别的信息,无效甚至有害。




欢迎光临 爱吱声 (http://129.226.69.186/bbs/) Powered by Discuz! X3.2