设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 4103|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
- Y4 A4 M3 y. ]7 C" b* f4 k8 n' x
把PDF上传,然后让他抓取文字,并修改可能的错误。$ ~- [) W# T0 N5 Z! V' m$ Z) C7 Y& D- @
然后deepseek完美的完成了任务。) M6 F( c3 t1 ]3 u' e) f; J
段落清楚,列清楚,页眉页脚全部去掉。  A% U& W) j. h
我要疯掉了!
( v+ a" i/ Q* x$ `. T7 H# n3 P! |9 Y赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
3 ]' b& M, n5 F- m% K5 a! `2 S' S) u====
) h$ w' k# j6 f4 ^$ s中文也很完美。& r8 K. T2 o* K& g
经验值,每次十页比较稳定。. b. R$ Q+ A6 v8 H) D
现在我这里API还不能用,等恢复了,全自动了。
6 S: ~( ~1 t3 V7 V" `5 S====
' f- _" {) {' ^8 y! L; z, b- d7 K第二次疯掉了!" T) r$ f8 ?' |3 C
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。. x$ V$ T4 s. c0 o
====
1 f% _( T2 ]7 n现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。2 c: M- d$ g: l$ |! y/ q
但是任务多了后,每次翻译的页面数是减少的。9 P, A% g/ d1 D9 v0 i& h
好吧,我五体投地,继续探索。
7 J, ?6 F* B$ R) M/ L8 ^====, q* t6 c. p( z1 q4 J9 L0 X
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。8 v3 K/ L% k: ]! O& |7 h. B0 ^
====0 z+ m  a. _) S  c* K
好吧,有些东西是不给翻译的,哈哈。
, K7 h6 N$ a$ t& b# A! k$ q1 w, j4 T: r" k- i) F8 Q
Sorry, that's beyond my current scope. Let’s talk about something else.
7 a# G. s9 }/ \" Y0 o, B4 l====& C: u+ N# o  `" }% m- g) C! v
然后我的英文命令也让deepseek 帮我修改,呵呵。
9 S/ z. q- z/ b% ^: \====
7 |" p: \- B( q7 \/ `日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
1 K' Q% \' G, c4 S- Z====. F7 ?7 q4 a3 ~% A5 q
时间段的话,北京时间的下午和晚上用比较好。. r: C3 ~6 Z6 I2 ?
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。, i# g$ W: F/ L, I1 b* B9 A& m
====
/ N# D/ n! G* w; z用千问吧,非常稳定,非常强大。) i) j3 t3 i% S0 C7 D7 [
https://chat.qwenlm.ai/. X, M2 P- D+ p, K% E+ Y+ {
====/ B: c2 B/ b  j1 B* X
Deepseek,API 看上去可用了,但是不给充钱。2 Q) o7 V% @) {0 Q7 |3 ^4 Z
3 ?" H/ p2 C6 C2 X6 d- P
0 X- ]0 y* O$ @0 u' n4 Q5 a0 z
# r$ a: Z7 f1 k- M, A+ l- n

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53; B$ T+ x, s+ i1 l3 {" }$ F) _1 @
    这功能很赞呀
    - ?4 m! M0 H* A2 x# `9 e
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    衰
    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13# O$ G( `; w- I$ p+ X$ I
    有没有上传整本书试试
    ) w, I! j7 G# W7 p) L
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    5 M2 N1 ?  U5 ~0 I: G
    . O' `: U0 m, g/ E以后让deepseek 读出土的竹简
    4 y& s: `" A0 S$ b5 a' U. I5 D2 L( }; V  d
    还有把古文翻译成现代白话" ^; h& O* c  h  k" q1 h

    5 k0 s$ b7 U1 X6 F- l$ D以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    2026-10-2 18:41
  • 签到天数: 3071 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    9 V: f; @. T9 F3 u
    ( W4 }1 E" [! w% c' ~我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    3 Z8 }9 J5 W4 ]1 U, a请教是如何实现的?8 w; Y0 H$ \; ]4 X* y; h% g
    " c  X+ T- n  P8 F" [
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    0 m) k( m( z, m* q) y( X3 U6 o4 {
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。: F7 i9 H" R" d7 M3 U2 G
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。, {0 [* |6 r+ D; Z& e5 y' X
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。% j+ n) X0 g* D4 m0 j8 W

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    & V7 ]* Y# j" T2 @# r/ I: Y" v请教是如何实现的?1 N1 U8 T1 A# k% e  P9 ^

      |1 u1 i4 V+ s2 l! N7 j( _9 M/ C我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    ! W6 T& R: e: k* J" C( i3 v/ W+ C0 Thttps://chat.qwenlm.ai/# g: W7 C$ B- x9 y; Q9 ?
    试一下千问,估计美国人没有攻击他,所以资源敞开用。, J- B% G5 f  b
    很稳定,质量不错,好像最多一次处理15页。# ?9 @, }% |, ^8 P, i
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:03
  • 签到天数: 3177 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    # ?5 B. o1 v+ A% s处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    - n0 U, j' n% ^9 l4 m这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    ) o0 p$ B& F& N- G7 ^7 t
    , E: |/ r7 d. Q% chttps://github.com/oomol-lab/pdf-craft8 \$ K, Z% S) O9 y+ c

    ; T: o' [' x! k1 V. r: c3 Z2 Q1. 这个工具要求装 python3.10
    % u# c7 u- ^" O' {) T4 q2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.02 v/ w% }# ?) T- J# D  D" S* s
    3. pip install pdf-craft
    7 p. L" N6 ]! n1 c1 T2 k* n4. 把下面的内容写到一个文件里,例如 a.py
    ' ~3 f& B: c' r( h8 x7 X' _& C* m' S( f' q  A+ I/ i& i
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter, M2 f* ?3 C: [  g, D% ^( {, i

    2. 0 g4 _6 J1 ~6 A+ E& m/ X2 }" x5 A
    3. extractor = PDFPageExtractor(. ?7 t/ P2 V9 p
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.4 j" \; q; P( m% {
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed9 K5 z2 x* n% a0 F. \4 H' k0 c
    6. )
      $ M3 P' W: o+ W9 U& A
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:9 H( ~  b3 I$ S! a+ d& Z9 {: u
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):& o6 T8 {* @6 j7 g( }- Y
    9.     md.write(block)
    复制代码
    . L5 z) u+ E) L) b; V; [( M
    , [, G% J( N7 G9 W: l
    要修改的内容:
    % q3 |2 J  B3 j; U4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型) E  Y3 j/ ]8 x1 @, Z- q; j6 t1 E
    4.2 markdown_path:输出的 markdown 路径文件名
    . ^2 m9 M: h; y0 k% z( G7 O4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    : h7 x5 i, K* ]) {- P& I( s* w% ^- z
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    $ A7 G4 j- u5 |. l1 |9 h5 J  p" I6 i* p* M5 f4 V
    目前为止PDF转纯文字的最佳办法。
    . ~7 u2 {2 U9 N1 S: U& d( V先写个小程序,把PDF按章节切成小的PDF。
    ! k1 h( L; |6 R. H( o% C然后,把PDF一个个传到deepseek,让她抓取,除错,输出。" p% ]# h+ F# l  j
    效果非常好。
    8 F1 i0 c/ n8 c! z7 B5 w" x
    : S% \- R# y& rdeepseek,qwen,chatgpt 三个,deepseek是最好的。% }0 F( C0 u" Q3 L/ J- @! \4 w
    7 ]0 h" @) F8 S8 n
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    ' ]4 _: }- M- t+ k8 k2 }$ S* K) Q+ Q而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    + |2 I. `; T2 S2 v1 D( \9 l$ Y我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。8 B& h' u/ Z5 g; S7 Q7 v
    0 n5 }/ ]- A. X. O% o
    API到目前为止,差强人意,不如网页版本修得干净。
    / M3 Y; w5 J4 x" h: O
    4 E: B8 Q" f7 l5 s( X! zdeepseek可以同时开四个。
    ' d4 V' O  j5 h. q

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 - S' h' p8 C% a+ S, `  }  a
    % I. }  l4 {: r8 `) j
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26  M! K# c- M9 u& {  g; a& _
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    3 \+ d" ~* [' _+ M! _2 l! p
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:330 W4 Q. ]4 w3 F7 Z3 r% }
    细说一下,听上去很不错,多谢。
    ! h+ B& e8 h# V1 R# F; K1 v
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 6 j% @) ^' ^$ Y, r' x2 `* K

    ) C3 I& w! y, v# h: Y已经搞定.. r* m7 N% H; Z

    " z. q7 }3 V2 h! W首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。) Z0 U& Y' H2 b- u- x
    ( k. t, p; T& C0 ~
    1, python + pypdf 按章节拆分小的PDF
    7 G; B& {8 h! v) ]9 V9 Q! O; Y$ j* ]. M3 U
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile, Q9 g6 }8 e7 r& _  Q" _8 {, r
    + B( {! R- P) v, R' @* {) {
    得到text file3 O% l" ^0 @5 S/ t0 O
    % c/ E; `- o4 y; x
    3, python 读取整个outputfile,丢给deepseek 矫正。# o- \/ c5 k/ B0 W) Z3 W

    4 j7 P7 q* h" @模型是 deepseek-chat4 i/ w" c4 R4 ~# l  t5 z, V
    - ?7 H- ]6 l& }
    max_tokens 最大是 8192,别的不用改。
    $ S# H# y9 i6 \
    5 R5 V7 Q5 s+ `9 M7 a- q参考:
    , ?! U0 m9 D+ N$ x+ Q* u7 Z! Thttps://api-docs.deepseek.com/api/create-chat-completion7 X2 D- \: q' N

    + R0 V/ }1 z) s4,费用:
    9 w: i7 S# @8 g) b7 Y2 z" \: p( L/ u7 K
    实测:
    ' j0 D* w" l; f6 N. e$ k% {
    4 R  d' u+ d- D3 s# l: r' P. Q4 Y296K 字母,用了 9 美分。2 S  i* m7 {. u
    . _, X: o; H9 y- S% T2 c
    英文字母 到 token 用量大约 1/3/ n8 }& N/ M; u1 F/ P0 p& f% n" v+ V
    % u' z; w' _2 }1 g0 {6 Y
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  328998 H& ]3 Y8 p: m' X& d4 |) }7 f
    * R" R+ v  t# ~2 k. `) b3 T3 u
    32899 个字母花费 11782 tokens,包含输入输出的 tokens2 D$ I  c% J; w9 K
    , P+ U! g  ]# G% R8 Q, l
    价钱,非常非常便宜了。
    $ T; L1 @8 F5 z. t9 l9 j4 }5 x, B: `! p% V( n. N. v3 \
    参考如下可以计算,懒得算了。  g7 l5 y; Q% K
    # w' J4 p& p1 h' M3 X+ ?& j
    https://api-docs.deepseek.com/quick_start/pricing' Y/ I+ K/ [: j* b

    9 S% {" h4 L9 B5 R% e6 p, r( t1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    * K& V1 S7 s4 V1 \( i1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55. R* H. j) d9 J& c+ t" n, \. }2 {, z6 _
    1M TOKENS OUTPUT(5)                                              $1.10                $2.195 z. S3 ?9 X( k( V

    7 q% ^( S) |0 u+ w) c, I0 ^: p5, Balance
    ' \* J, a( F) Q+ \' q
    % R* \. m* @/ A% }1 I" ^可以在程序里调用,知道每次运行结束后,balance还剩多少。
    . p, r7 W4 ~4 ^  D+ {: q, B参考:
    / n2 X8 F1 B9 w  T9 C. Jhttps://api-docs.deepseek.com/api/get-user-balance
    $ K" }: F& b% _
    4 \! C6 e" v! D6, Models" D+ w3 J; E. V1 _& j
    1 q, Y, l5 ~9 C/ e
    目前就两个0 o2 A7 A  E( Z. x& S
    # deepseek-chat) f7 ]2 f7 M6 ~; d9 d& ?4 P
    # deepseek-reasoner  \) V4 i; l* j1 U5 m' I* C
    % }6 i" }0 x) u4 o0 i
    参考:7 O% m& [' A2 |, A
    https://api-docs.deepseek.com/api/list-models% e6 x: Q9 [' N; k3 p2 ~9 i# g9 Z  @% V
    3 P' D2 ]* @4 ^2 R9 A/ b# L
    % ?, G* Z& Q! q. L  d# C
    7, 问题7 w4 E( n, A/ {" z; V+ c

    # T2 j& T$ s1 Zdeepseek 会将前后两段合成一段。4 e5 J$ q  m5 q# w4 m3 [0 f
    特别是那种大量的对话的段落,deepseek会给你合成一大段。
    $ N) B, R$ \% E/ o' ~" _# L( y2 A7 S1 j$ q8 V; r
    8, 钱说了算。
    / t/ m9 k1 Q6 ?3 F" O! e$ w: u( F6 H: s4 s8 T+ @; l: m4 L
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    : J/ w0 G( \8 q( O; d3 f- R但是API就不会出现这种情况,毕竟我们给钱了。( c0 G6 l) X3 E+ `8 f7 E. j
    chatgpt也是这样的。
    ! M+ n! ]2 U% T  A, |
    . G0 F3 b6 @% c' b: e7 q+ {* u6 ?& a# j! ^

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-10-11 03:54 , Processed in 0.065475 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表