设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3949|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
- b, X1 r* d, `& j) E$ m3 N- [2 ~$ |$ x: j$ c' t" [
把PDF上传,然后让他抓取文字,并修改可能的错误。
7 ^8 ~$ _6 }5 C+ t然后deepseek完美的完成了任务。7 O; w' ~9 ]+ B0 u- l, A) ~
段落清楚,列清楚,页眉页脚全部去掉。
2 |( W- y6 o6 r' `6 w; j我要疯掉了!
1 C" J. _( c7 `4 S5 G3 H, j, k赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
. Q$ X0 U( @+ W% `- y====, T6 o! d/ |- ^" X
中文也很完美。
3 M! _- g9 Y7 c9 `0 g8 V( h经验值,每次十页比较稳定。
4 B2 I( ]  D0 Q2 }) J3 r$ u; Q' H现在我这里API还不能用,等恢复了,全自动了。2 M: x6 H1 k) j. p$ X, S
====& W) t* n% K: Q7 n+ I  v
第二次疯掉了!4 @1 B2 K2 a. B2 k6 M4 \4 l- T
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。4 c; _7 O* ]2 S- A. c% J
====9 ~( h0 I0 M3 r9 c  T
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。/ Q' O1 U% z- z4 W1 E
但是任务多了后,每次翻译的页面数是减少的。4 m0 Z4 M) y. a, B" H; f0 v
好吧,我五体投地,继续探索。! z! P. L; _* N" R0 `; T# v
====' p. `, [! E# C2 f6 X/ Q
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
5 V# U0 @+ J1 }====
+ i6 V/ W9 F- h' d: A& C/ ~" }好吧,有些东西是不给翻译的,哈哈。
% [$ L1 ~; |* q! o  C2 j, A+ m5 [; o) l' q! @. i0 I
Sorry, that's beyond my current scope. Let’s talk about something else.9 E0 B. M8 S. [+ A! y9 i
====2 I8 s& O: F# @  {
然后我的英文命令也让deepseek 帮我修改,呵呵。8 Y0 a$ J$ L% n
====
3 g9 W; M, q) B* g, j: Z' o8 _6 K日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。/ N  H2 b  i; ^# V0 E- L$ M
====& A& k7 _. [  S& o. l* ?0 f1 u
时间段的话,北京时间的下午和晚上用比较好。
$ t* i6 b. e6 B; B* G后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。; J9 L1 {" V+ ~2 m1 u7 x# N: Z
====. ~3 f/ m5 m1 C' E( Q7 W$ Y! X
用千问吧,非常稳定,非常强大。2 a* h$ j/ }- v! P! l, s" T
https://chat.qwenlm.ai/! ^8 s6 S0 n/ C- r% w: [* n/ H
====
" T4 V  e: V$ z4 l- q2 |2 {Deepseek,API 看上去可用了,但是不给充钱。, }: S  S- }6 R5 F% \+ N- k* @; {

( t/ {1 _  F9 q1 y6 O) W" p* {% y2 a: B0 }  V
1 V; c6 C6 N3 ^8 T/ f. X( D

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    7 小时前
  • 签到天数: 3912 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    ( c. Z4 U; j' f* c. W- |! ~这功能很赞呀

      {- d- W  k' u! N简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13- k$ z2 x7 {, v% H! k
    有没有上传整本书试试

    ! J8 q1 i4 P" b. y# O8 V目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    7 小时前
  • 签到天数: 3912 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 : c2 l& W; g0 j% G9 J, E1 c

    $ o# H( W3 p  _" @/ P. H以后让deepseek 读出土的竹简
    ) a% Z- ]' F& T0 O3 D
    8 V& x) [; L: l: w; x. a. D还有把古文翻译成现代白话+ o% ]( k3 w+ w4 K' u
    ( z; d# p" }* @7 r
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    前天 18:59
  • 签到天数: 3067 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?$ }5 `6 a9 Z% _, z5 u% V! ~

      \( j0 l; y3 u. e$ P* p8 }我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    - ~: Z% p" m( L+ s- I请教是如何实现的?% [8 D0 V0 a8 `9 O

    6 w$ u+ A7 j$ _我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    ! S# X# N3 I* s# _
    / |: O" l# E3 w( H- C4 [
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    * L( z. }* q1 T- q* z$ H- V文字之类的没问题。估计deepseek现在暂时只保证主要功能。) H: L0 F; f2 o, y. k
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    3 ~  @0 t% W, Q8 N2 w

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23; j1 t, ]0 C7 H* u8 p
    请教是如何实现的?5 o* b2 L8 `( j
    4 P$ d" X, X* n6 e- L, @
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    $ f6 Z6 m! [$ G. c
    https://chat.qwenlm.ai/
    $ v" S6 B5 r. L( o; N  s试一下千问,估计美国人没有攻击他,所以资源敞开用。9 g2 P  O: g3 R' `% j
    很稳定,质量不错,好像最多一次处理15页。! \1 l6 _9 x% n: x' K9 w
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    7 小时前
  • 签到天数: 3174 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。* e2 Y6 j$ ^+ }1 y( @% b- q1 v
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    - t+ f) ]* b) B4 _' @这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    ! S  L8 r3 A7 g
    & h% n" P3 M0 H1 n2 p3 T/ M* D) xhttps://github.com/oomol-lab/pdf-craft3 t7 d) ~( ]4 S5 Z

    8 s- ?' M8 ?) ?7 Y1. 这个工具要求装 python3.109 p6 n# |* e& `+ b) M% r+ w
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0$ @" B  i+ o1 O
    3. pip install pdf-craft
    6 ]5 S% ^/ |6 P  ^4. 把下面的内容写到一个文件里,例如 a.py7 E) S  ?- \$ Q- w
    2 Y! D/ ~- |1 V. \0 S
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      0 J7 [( X; l: R2 O# U4 C+ @$ \$ y

    2. $ J& @: Z" G. X2 m( S+ |7 S. d
    3. extractor = PDFPageExtractor(; o7 b+ l& `$ F1 q( z' P
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.3 j% l3 k4 R3 h
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      / }4 V9 B8 u9 ]; o+ {- a! T7 a
    6. ), j8 L6 I, h+ h% [- |
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
        n+ c' I3 N- R6 P
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      + y- Y* j5 u8 x+ Y" i
    9.     md.write(block)
    复制代码
    & _- X, W* p, e' G% g

    0 d* d2 D$ C+ Z* `# C$ _要修改的内容:0 ^) N- G, C6 s1 K# v
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型% y6 B3 o* W( E# l7 ?: u
    4.2 markdown_path:输出的 markdown 路径文件名
    * `* s: o0 ]: ^5 }: M4.3 /path/to/pdf/file: 输入的源PDF路径文件名4 \& Z8 l/ b: C8 A/ |
    8 _3 o( p. z% f8 Y! r% ^
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 1 i. a/ M. p& \, \  X; P1 T
    ! U: t9 G% a; A$ Y3 {
    目前为止PDF转纯文字的最佳办法。
    2 |! D$ E% s! @% Z6 l0 k! N( Y先写个小程序,把PDF按章节切成小的PDF。
    7 d: j, t6 L# ^然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    ( M  Z+ ^7 {; J效果非常好。
    ; G1 j6 d) l# Y/ G4 ?/ k
    1 C) [7 v" h$ L& X: ^deepseek,qwen,chatgpt 三个,deepseek是最好的。
    5 B* [3 @; U' \7 g
    + _% G. ~: v1 C) q$ ~deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。9 p2 I* j. R9 _* z* X" X
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    2 b1 U9 i/ D4 }. Y  e2 j, C我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    ' i9 t; e  M% L6 }  |5 _* h/ U, i" d
    API到目前为止,差强人意,不如网页版本修得干净。6 ^, f$ U  u9 Y% g' P1 T1 q

    2 ]/ [8 [) f# W" [" cdeepseek可以同时开四个。
    : `3 X( d9 A2 v$ S* Q+ p

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    # |/ A3 z0 W3 K& A# Z) |. j4 ]( g& z# @
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    ; Q  o$ w# u- A: p  ~让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    9 y. R( I6 @- z0 j1 e% S, ^细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33/ c# P' V. L3 _2 d4 a' R8 B/ _
    细说一下,听上去很不错,多谢。
    4 W# [# q8 @& R5 d, W
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    ( ^4 Q" s) J) ^: M1 S# C  }' \, ]* z* c. z) L
    已经搞定.2 p9 X. m+ \+ R, I! |( ]
    . k% Y. F% q5 ^
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
      _( x) e, |1 Q* ~$ i. Z
    0 |1 s' X# i, U# Y; w+ J& F2 Z1, python + pypdf 按章节拆分小的PDF' {3 c! Y/ w- R3 f
    6 t0 S; \9 a  ?2 N& F' o
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile( K4 w/ w) Q8 u8 r7 @1 U5 V
    ! I& T! s- C7 ^$ k
    得到text file, z$ V# G, _" W" r; p
    : r% k& @0 c: E: a$ j
    3, python 读取整个outputfile,丢给deepseek 矫正。
    - v# `" ^. b8 h; W9 Q4 [! p$ x( J
    , u0 ~  x: X  K. Y模型是 deepseek-chat0 Q  ?' w# i) \0 K

    ! N/ o0 t4 q2 k: E1 ^& V. y3 A3 Wmax_tokens 最大是 8192,别的不用改。$ s% f1 {4 \4 Z" \" q/ N1 O
    ( [  e6 c5 H! \0 M" d/ r
    参考:
    5 u" r/ N2 z8 g3 t. N) i& j4 ~https://api-docs.deepseek.com/api/create-chat-completion
    ; M, u9 F% Q7 v9 i. X$ J1 S2 d4 I  n0 h& a' g6 d* t
    4,费用:
    + t5 s$ ^6 p/ G
    3 X1 @* I$ T$ z/ R4 i+ Z实测:
    " S0 D8 O. O7 E( Q
    ( U4 t- ~* X7 A/ N5 ]6 a296K 字母,用了 9 美分。9 M4 u7 {9 h; O4 g

    1 |9 z- x# U) U" @* @8 s英文字母 到 token 用量大约 1/3
    ' r9 c' F2 G/ v* ?: Y% _( r! m) u. d! \3 @- @% t/ C2 b( k2 J
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899) C0 l% h! i8 K& u- @. Y

    ' t/ A! @' P6 L& u. t32899 个字母花费 11782 tokens,包含输入输出的 tokens
    - Z8 T$ K3 x) S( P+ m7 v1 X% i) ~7 I5 M" S
    价钱,非常非常便宜了。
    : o1 L% K1 B' U2 o- l0 _, j, @. R& `! y2 X3 m& }: l
    参考如下可以计算,懒得算了。
    5 D- {' N, Q& P$ I: E
    ( R2 e* s- q2 L7 |5 ~0 I3 l0 K, yhttps://api-docs.deepseek.com/quick_start/pricing, L, }( f$ f0 |# K( |
    $ w7 ]$ ]% x% C. J/ |& s
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    # p: J& `( s& h! M1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.553 Z& o3 b2 E0 s# b/ Z: u
    1M TOKENS OUTPUT(5)                                              $1.10                $2.196 `% ^- s1 ?8 H
    9 ]. x2 x) M5 A, z; s
    5, Balance$ X) p. d" i; C
    , M' @& @  E1 c4 Y8 F
    可以在程序里调用,知道每次运行结束后,balance还剩多少。
    7 ]) ?# p  \( J% w. Z& M参考:; K9 W! @$ F2 g
    https://api-docs.deepseek.com/api/get-user-balance
    4 M0 l! N& R" ~5 g( X
    7 c* n  X) B( D8 x- G5 m6, Models5 ~7 s0 y' s) R" x  P/ X( o8 }

    ! I! B- N4 [1 R/ X/ |2 Y5 `, @* O% k目前就两个: [* p" \. @; a$ N( s( D- H
    # deepseek-chat+ v9 ]; W& W( G- T4 r
    # deepseek-reasoner
    - u; |3 v) ~6 v% M* N- O" \* g+ I+ G2 ^) r+ D
    参考:9 b. `/ b8 j6 a( Q& O$ X
    https://api-docs.deepseek.com/api/list-models( g, W# I! n2 Y! A1 i! V

    + I3 n( A5 ?& L# C8 T( c6 T+ v* @* o  W, o/ i
    7, 问题
    8 }" X$ t2 Q( h$ R1 P3 K" l4 g" E. A" a, }8 n
    deepseek 会将前后两段合成一段。) V( y/ [" o! [* N) x6 S
    特别是那种大量的对话的段落,deepseek会给你合成一大段。  L, q# O8 ]. R4 A7 N4 c

    ; z" l! U' v, `9 w9 X3 P$ b8, 钱说了算。
    ; H1 v; d, V5 E: O. b/ _
    " H' u" k  f% V" Ndeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    2 S- S/ ]- k9 V# E但是API就不会出现这种情况,毕竟我们给钱了。
    ' ?- d6 \& p: k) g3 \9 j4 achatgpt也是这样的。0 j; h& A. `6 S- X  v  V
    + E2 w, z: A+ _
    * A( z) v1 r$ j* b4 t/ F

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-21 07:09 , Processed in 0.069848 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表