设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 2078|回复: 5
打印 上一主题 下一主题

[科技前沿] 中外大模型数学能力比拼

[复制链接]
  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    跳转到指定楼层
    楼主
     楼主| 发表于 2025-1-26 17:34:23 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
    本帖最后由 可梦之 于 2025-1-26 17:57 编辑
    $ B9 v* P/ t; b8 x0 `: b* {; r* R& c- [1 J
    遇到一个数学问题,懒得推导了。习惯性让GPT推一下。
    ! y* ?7 C( c& N% f' V% h
    / A6 {2 c! K: D最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。& ~8 j, V7 X; _& G2 t
    . n! i" f: }" L) L4 l: w9 d" B

    ! v, e! E& R6 q* ~- E/ H5 _8 k可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解
    + C1 p: a9 K4 S, ]! [, A, N* b- b9 P- \% c

    , J4 z/ {. t% Y6 b( l1 @& E' e3 Q* z; K# D4 j6 A

    9 j' C- ]6 q1 T5 c& q, X2 A! m9 `: Q
    要么继续胡说八道。  l. K+ v( {" f3 n) E
    + i3 o( j- c; `

    6 s) O. C) }( X8 T1 `抱着试试看的态度,把同样的问题扔给了豆包和deepseek。
    ) u8 L" o) W  f' _6 v- G) b/ E+ B1 s; t5 Q3 O* _1 l: i! E9 s5 f# e
    deepseek速度快,结果也对,但是过程是不对的。
    8 \- h/ z9 g9 y8 Y' p0 Z/ m5 Q& R
    ! W" Y9 k% N/ L" x' n  R9 j9 @& x
    豆包过程比较绕,但是基本正确,结果也是对的。* P& V8 s$ p5 D7 f- _
    6 B; p$ y4 Q* a! M
    + M. f8 x, W& U& p. s6 u8 D
    当然,都不如人推导的哈。
    6 P  ~" C' g3 |8 C1 t, A# n
    ' \+ @# E1 \+ [" o! q
    3 ~2 m) t+ T8 ?7 Q1 G过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。- \1 h4 Z5 `3 G8 |: T
    ! H/ h3 N, v1 ^2 C, c8 K3 l" a
    虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。
    0 P- j; ?# I7 j4 o8 c" u8 q# u9 {- x

    : i1 s7 L1 k- [7 H/ Z$ d# R/ k% e( L
    ( k! |7 |# P9 O. Y0 M! k
    " t* L" R3 ]; {' k6 ]6 P( g# K4 f3 Y- W8 X% z$ t2 @

    评分

    参与人数 4爱元 +36 收起 理由
    helloworld + 10
    方恨少 + 12
    pcb + 4
    johnsonjian + 10

    查看全部评分

  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    沙发
     楼主| 发表于 2025-1-26 18:52:01 | 只看该作者
    个人推导错了 落了一个系数2.
    8 D' T+ {$ k3 h% |+ A8 p  U% y! P, T% |" T2 t
    这也是我们需要AI的原因啊
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    3 小时前
  • 签到天数: 3854 天

    [LV.Master]无

    板凳
    发表于 2025-1-26 22:43:24 | 只看该作者
    我没用过花钱的AI, 但是我觉得各有优缺点吧。9 A9 B+ S; \" m2 ?  ^
    ' B% p. R! f; w) B, G6 R4 Y
    要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。% t- Y$ y8 }  S" X4 s' H- i, L* V

    ) X2 K( x4 ]* o$ G/ u即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI
    : P) G3 F, C7 I. g9 p6 f1 i" w8 A) m1 q4 K. g0 D3 h. w! C3 A
    现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;
    / ^4 e( z; _/ O: c另外的一个笔记本我基本上只常规使用搜。
    ) i5 \" b* {( [! |) ]5 @9 L8 [
    & r, I0 x$ h) W5 u; \/ w我个人的本上装了好几个AI, 经常每个问一下。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    1 小时前
  • 签到天数: 3015 天

    [LV.Master]无

    地板
    发表于 2025-1-27 01:55:48 | 只看该作者
    马鹿 发表于 2025-1-26 22:43$ |( S0 k5 n' |  g) R! b
    我没用过花钱的AI, 但是我觉得各有优缺点吧。/ p+ \0 ^; O, m. Q$ y9 W+ d) x# J
    ) ^+ I' j9 d( P0 H) N: q
    要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
    我个人的本上装了好几个AI, 经常每个问一下。

    1 H* g& f7 h9 Y: V4 D6 D: i. Z" \+ ?, k7 ]- H7 R( s
    所以到底哪个更好?
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    慵懒
    2026-7-9 09:29
  • 签到天数: 2599 天

    [LV.Master]无

    5#
    发表于 2025-1-27 03:30:40 | 只看该作者
    Chatgpt数学非常不行。以下是个典型例子:5 b: a0 C1 |4 b" }
    : J: K& J8 `5 I# N4 N5 q
    9.11和9.9哪个大4 J; }$ r0 b: r9 E
    ChatGPT said:# h9 y/ n, D+ o5 Y7 k
    ChatGPT
    ; B$ J( g) z/ }9.11 比 9.9 大。
    6 w4 x! m) H) z' U7 m; ]% N9 y1 f1 v
    原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:
    % z$ F( r9 g7 {$ w9 b! K: A" H1 k
    9.11 的小数第一位是 1,9.9 的小数第一位是 9。
    5 G& E! Z( E6 g. k2 N) m6 N由于 1 < 9,因此需要继续看下一位。
    ; j& M; `: y0 s8 W+ y0 j5 _  p9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。+ S9 Q' y4 q" U! F( l) e' o* P
    因为 1 > 0,所以 9.11 > 9.9。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    3 小时前
  • 签到天数: 3854 天

    [LV.Master]无

    6#
    发表于 2025-1-27 03:44:05 | 只看该作者
    方恨少 发表于 2025-1-26 12:55
    6 A& s  ?% z+ }! }, p所以到底哪个更好?

    & V2 d  R; M  ?说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。
    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-7-24 03:29 , Processed in 0.063590 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表