设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 2071|回复: 5
打印 上一主题 下一主题

[科技前沿] 中外大模型数学能力比拼

[复制链接]
  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    跳转到指定楼层
    楼主
     楼主| 发表于 2025-1-26 17:34:23 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
    本帖最后由 可梦之 于 2025-1-26 17:57 编辑 3 L- i7 L! [1 t5 v5 G4 _( X

    9 E* G, l, i2 l遇到一个数学问题,懒得推导了。习惯性让GPT推一下。
    ' g4 P# u& Z1 V/ i' d0 m6 V5 u" ]$ v7 @; H. k
    最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。
    : G8 E- o& G% f* O$ i) @3 @- T

    / |* i- y3 H5 ?可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解, t! J7 f( g' C* H6 z

    $ K! X7 |, o  m) G8 d1 b
    5 P  O  V# I' @% [) g* Q3 i( l* m/ z- Z5 k& ^5 c+ ~/ T( o, }; X) h
    * F. u4 J) k# y- d+ F1 h# O: x

    7 [1 V' ?* [& u  q6 u" A要么继续胡说八道。
    7 H2 f' e. w- Z) l' J% }1 |9 N
    " @- N! j" l- d; n+ O% ]7 h* `
    # F# X5 z! P, [# i, Y抱着试试看的态度,把同样的问题扔给了豆包和deepseek。% A7 |/ U+ ]4 t+ V6 G) R/ `7 e

    5 z- r& d" N- h* x" X7 J( ?deepseek速度快,结果也对,但是过程是不对的。# M! e. j& l0 O
    ' A; `: Q; ?# u

    3 {4 l: x7 }- [8 Y! q, f# p豆包过程比较绕,但是基本正确,结果也是对的。
    + r# [! [2 b3 A
    8 M2 O' s' r* J( _! U1 f# f% T7 @& r. R" [$ u( O% w# M) c
    当然,都不如人推导的哈。8 O0 h$ |7 W. Y+ a  w7 P/ _% e& T
    , \( a' Q1 S+ G% p+ [7 A7 u
    5 ]& X2 o# c, V" s
    过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。5 ^" [; F$ {; i9 _0 B5 G- f* a

    & }! K* M$ B9 {+ A7 L' k* ~虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。( C; U" b6 |! e' N7 ~2 x

    / y2 f6 [5 X+ x# x! W# K& n- ]7 H# w

    ; w/ S6 E! z: `; D  U
    , H4 n& k/ J4 F7 z2 N% }5 f- S7 ~7 l: v+ v

    评分

    参与人数 4爱元 +36 收起 理由
    helloworld + 10
    方恨少 + 12
    pcb + 4
    johnsonjian + 10

    查看全部评分

  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    沙发
     楼主| 发表于 2025-1-26 18:52:01 | 只看该作者
    个人推导错了 落了一个系数2. 3 V" L8 P5 Z6 J

    " o* R, ?' H$ C$ w. j2 D) P这也是我们需要AI的原因啊
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    4 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    板凳
    发表于 2025-1-26 22:43:24 | 只看该作者
    我没用过花钱的AI, 但是我觉得各有优缺点吧。
    ( v" Q( J/ T8 M- k- ^4 B! z" _" k1 p- K& n6 j" o0 h# H
    要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。5 X; H9 Q* W  _) P0 d9 k
    % G, [4 U& `/ e+ J* n0 n
    即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI
    # N+ y3 h; o* L" ]" Q) _  [5 f6 ^; t( i- e9 W3 S
    现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;& Q5 k- K6 L6 p" o
    另外的一个笔记本我基本上只常规使用搜。7 J8 P3 l. b; A. y

    $ ^2 _& r& D1 o' @/ ?, ~我个人的本上装了好几个AI, 经常每个问一下。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    4 小时前
  • 签到天数: 3013 天

    [LV.Master]无

    地板
    发表于 2025-1-27 01:55:48 | 只看该作者
    马鹿 发表于 2025-1-26 22:43" _) t1 G3 @' P& F/ q) ^
    我没用过花钱的AI, 但是我觉得各有优缺点吧。
    + M/ O7 C' t+ a1 x( R" y0 b$ g% m
    . g2 ?- d  B* c4 N; R! k* c要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
    我个人的本上装了好几个AI, 经常每个问一下。

    2 i/ K# V% C: D) V; G7 _: k6 g3 T4 m" ]
    所以到底哪个更好?
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    慵懒
    2026-7-9 09:29
  • 签到天数: 2599 天

    [LV.Master]无

    5#
    发表于 2025-1-27 03:30:40 | 只看该作者
    Chatgpt数学非常不行。以下是个典型例子:. U/ B+ F* A8 w1 k6 G: N4 V" w

    3 P; g- B2 s0 Q9.11和9.9哪个大6 O9 d2 F( P5 \  I- R5 U
    ChatGPT said:
    5 {3 _" v  q9 M* `) V0 oChatGPT
    . ]3 ]% h! k1 M+ S9 k9.11 比 9.9 大。
    ' W5 @, c% `* M) `* \( ?& f; T: ~% U8 {; \5 X
    原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:
    : ]. z. U0 ~& y/ b3 h. R! o7 j. H2 i" k4 Y
    9.11 的小数第一位是 1,9.9 的小数第一位是 9。8 t* h0 \5 f6 T' S: x( @
    由于 1 < 9,因此需要继续看下一位。, o7 X, `8 m* M5 I) N
    9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。3 y) Q1 f$ L3 C- y! {) j
    因为 1 > 0,所以 9.11 > 9.9。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    4 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    6#
    发表于 2025-1-27 03:44:05 | 只看该作者
    方恨少 发表于 2025-1-26 12:55. w8 Q) g* ~% t3 ~. C, i$ l
    所以到底哪个更好?

    3 k/ V5 _8 H* O1 b0 _  x' e, g说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。
    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-7-22 04:02 , Processed in 0.067481 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表