爱吱声

标题: 中外大模型数学能力比拼 [打印本页]

作者: 可梦之    时间: 2025-1-26 17:34
标题: 中外大模型数学能力比拼
本帖最后由 可梦之 于 2025-1-26 17:57 编辑 2 s& W0 l! E- Q* `
" b/ m) O) b* D
遇到一个数学问题,懒得推导了。习惯性让GPT推一下。5 \3 T$ |3 h9 c! y/ b  L( G
. b/ [$ a. K7 F0 E( _& g$ _
最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。
, I3 v; T9 p/ J, f, _4 G, G. C( n

# s* m6 b/ [" ?" F可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解
0 m/ J2 T) I. u* b# {( Z' B8 s9 ^  a3 J5 J4 [* b$ A/ E
$ {; M6 r' U5 I# B4 V# ?! z5 B
% H9 r2 J0 C  I2 e' E4 j

3 r" g! ^7 k0 E4 }# r. B4 y( w7 S( W8 X" H4 N& S8 e7 t
要么继续胡说八道。
2 c  ~- j* Q! j9 s  y8 V1 v; I7 `% g% J$ T

6 x* i7 c7 g; B, p+ t+ i' P抱着试试看的态度,把同样的问题扔给了豆包和deepseek。
2 z/ E% F8 F( c* @' r+ m, O$ {$ D' u
deepseek速度快,结果也对,但是过程是不对的。6 x+ m; L+ p* |
; ~" Q  U) I$ ?
8 h1 W, O, m; `) L) i) G
豆包过程比较绕,但是基本正确,结果也是对的。
% }4 ~0 m& {+ c
1 S% _: @& h4 g6 p! [) Q0 B1 }/ W7 e* t1 H1 m
当然,都不如人推导的哈。
# Y( e# K7 [6 h" W8 s
8 q! ?! n# ]* X7 t/ P! d5 Y8 Y- T" @' n& D1 I
过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。
2 h+ X) }1 n, q' n6 J0 ~% |, U! r, D% d7 U' l+ J! y
虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。) r- u. G! ^# A) H0 x6 c

; C3 o. F5 |- D% _( b2 {4 W! v9 F" i; e

) }: k5 x3 h, b  z! B9 j% Z3 d' F& y& u4 o, r6 Q0 E1 Z; Y7 J

( @' j$ w/ P. f) ]
作者: 可梦之    时间: 2025-1-26 18:52
个人推导错了 落了一个系数2.
6 _3 Z. }( L) c4 q! H0 ^: N& E5 V' u0 Z. O4 M/ `( o
这也是我们需要AI的原因啊
作者: 马鹿    时间: 2025-1-26 22:43
我没用过花钱的AI, 但是我觉得各有优缺点吧。
* w2 O; L4 B9 G( W
: ^+ x$ Z5 R$ y- K" L# Q, Y要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。& z* g: d* \  b
4 x7 l+ E) x+ F" x. s
即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI
. F' @% ^; b" A% c, x* p. b! m% C2 C( N9 w* ?+ }! O
现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;9 s8 |) P( [  U; ^
另外的一个笔记本我基本上只常规使用搜。
) e. I- C' x, A" X" Q' @7 l: }+ x$ O& ]* A; h* W( ^
我个人的本上装了好几个AI, 经常每个问一下。
作者: 方恨少    时间: 2025-1-27 01:55
马鹿 发表于 2025-1-26 22:43
7 p/ d* f9 m9 r. ^  a% A9 ~" k* u我没用过花钱的AI, 但是我觉得各有优缺点吧。
7 z/ B$ [$ d7 X2 d; t/ n5 G* g, M0 Q7 U$ Q$ x( `7 e8 k) E
要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
我个人的本上装了好几个AI, 经常每个问一下。
9 y# V3 q8 Q) [* H4 _
7 u6 _& e# C6 Q" `( M: J5 w8 H
所以到底哪个更好?
作者: 松叶牡丹    时间: 2025-1-27 03:30
Chatgpt数学非常不行。以下是个典型例子:
& J6 ]( J$ [1 v6 O4 H
* t6 G7 N* Y+ B5 j# u9.11和9.9哪个大
! ~7 z$ c) o1 q; L( B% nChatGPT said:) A+ e# m! S( F/ d% W
ChatGPT& h3 m5 \2 L1 ]! w* z! G" v* L
9.11 比 9.9 大。( c/ }' C& S2 f( P* N
9 y, w" F( f6 h6 t" K& r& j7 ?
原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:; H1 @# z, H* u) M+ v  U1 |

9 p. _1 b7 r: y$ u& B( h9.11 的小数第一位是 1,9.9 的小数第一位是 9。
6 c. P- R. J! {2 ~5 h由于 1 < 9,因此需要继续看下一位。
1 M' r) G* [2 B& N! K4 `+ O9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。  W6 r$ C2 L" ~+ i" i% c/ M  h2 O
因为 1 > 0,所以 9.11 > 9.9。
作者: 马鹿    时间: 2025-1-27 03:44
方恨少 发表于 2025-1-26 12:55
' W+ @# @) t3 R5 g. b" r* ?所以到底哪个更好?
7 Q; }* A% D3 @( W% h5 V6 }' i8 ~
说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。




欢迎光临 爱吱声 (http://129.226.69.186/bbs/) Powered by Discuz! X3.2