设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3752|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
3 y7 N6 x4 n: C% o
1 ~$ L! w4 {( h% W" w# m, G把PDF上传,然后让他抓取文字,并修改可能的错误。
4 v) h8 Q7 k+ S) N' F然后deepseek完美的完成了任务。4 I2 M# i+ D$ E( _* k$ L) y, q
段落清楚,列清楚,页眉页脚全部去掉。
$ O+ s0 i  p8 X# R, Y) L. G我要疯掉了!5 A) V4 e3 E7 Y* z
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
7 [: j- D0 k5 Y3 K  ]' `====) w7 `( w  P5 D8 S
中文也很完美。
& d+ s" j* P0 C% [& P' n- c经验值,每次十页比较稳定。
, Q% q6 b6 A! Q! K2 v现在我这里API还不能用,等恢复了,全自动了。9 R3 O" M  a1 g$ e2 S
====
! g9 n6 `2 m  h7 n1 i第二次疯掉了!* S2 J- H2 @% T+ d/ M
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
5 F- d* w8 d6 U====& k7 h( W/ |) K, |. _
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
1 _: x& q/ H( U2 @  B- h- X3 |但是任务多了后,每次翻译的页面数是减少的。; d0 ?0 K; G! _! {7 z
好吧,我五体投地,继续探索。' w1 o# ?) X: m- e
====* x. T3 y. ?  B5 I5 r
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。* X. c% Z/ S& i- y
====
! x- U7 Q: g; q3 o好吧,有些东西是不给翻译的,哈哈。5 @* D5 u% a7 P6 P
; Z3 e2 l* x  \3 S
Sorry, that's beyond my current scope. Let’s talk about something else.
+ e. }7 X1 h( h====
* [. x- _2 f3 N8 i! G然后我的英文命令也让deepseek 帮我修改,呵呵。
; E* r3 y/ P; ^- {% {====
2 J3 R4 O6 ~% S日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。$ ]9 \2 L5 x( ~
====
' N  L0 M7 Y6 C时间段的话,北京时间的下午和晚上用比较好。9 }, Z! a1 B$ {3 O) d
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
% d- _+ o% K; f4 i5 b====$ Q; A% W, a* h$ B5 g( t
用千问吧,非常稳定,非常强大。% ?8 S6 s" ]4 A& s
https://chat.qwenlm.ai/$ r) s+ B- X7 T4 c
====' d0 x) X" n" f( R/ w
Deepseek,API 看上去可用了,但是不给充钱。
- B8 O) v( K# N5 e: V( b8 t2 a
* q5 E( f! n& K' O7 ]7 c( v4 L& V. u# R2 I7 w; Y
. X6 y  o9 }' C1 Z6 |( t* r) C% e

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    半小时前
  • 签到天数: 3894 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53/ X' B1 A5 ?" }& _2 }
    这功能很赞呀
    - h0 J0 @. V1 p& p4 @+ s
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13; T) z6 Z* K; L
    有没有上传整本书试试

    2 _0 V% F' b6 M; D6 ~* c目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    半小时前
  • 签到天数: 3894 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 ' q8 E9 N/ `: Q- L' E

    7 z% r7 C: h1 U+ y9 ?2 d( V0 H: U以后让deepseek 读出土的竹简
    7 k( B$ p7 z: a1 K1 ~( A* r
    ' j; w1 ?. N8 D) F/ N5 z  i还有把古文翻译成现代白话
      W; I. {6 S& P$ y9 W
    / h- M% z) I2 p' q以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    昨天 06:02
  • 签到天数: 3055 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    ; e6 |8 s, X( \# y, |# R: V9 @+ X( |/ c. W4 O! F4 d
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23* a9 F& F9 Z9 z) I  V
    请教是如何实现的?
    9 H( s, Z2 N1 N* {$ T. {: {  l8 ~0 W' D0 H- R9 i3 @
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    ) i1 u2 f1 B2 i5 }0 B# g
    0 l- p6 g/ k; I- M- ~我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
      _& r. A. ]( A0 ?+ c+ r文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    ' M1 _, M5 C5 y0 L美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    ; F( X1 j' Q# p0 M) V& J

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    . u. v$ K2 A5 K  d* O请教是如何实现的?7 a8 v7 @2 T* }. e9 K- r

    / G8 ?, X/ w5 `3 \5 ]5 Z我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    9 v# t# m" @! G& p) P3 A8 qhttps://chat.qwenlm.ai/2 n* D6 `5 ~3 F( ?
    试一下千问,估计美国人没有攻击他,所以资源敞开用。! E& G0 W7 q1 X9 V* M
    很稳定,质量不错,好像最多一次处理15页。6 ]7 W. h3 j+ ?$ O, j* q+ o$ I
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    半小时前
  • 签到天数: 3157 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    1 P* b5 x* {6 @) k4 h7 e  }处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    % T5 U- k2 |4 K这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    2 F7 G, q: }2 ~0 v$ h( O/ q5 y7 G5 U  V
    https://github.com/oomol-lab/pdf-craft
    1 E" w8 d3 E9 v1 w/ O: S: w/ O) A2 x1 H
    1. 这个工具要求装 python3.10
    ' R% f, c; t. A8 K9 s5 I1 U% I2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0- v% f1 P/ O/ e) M6 T% g
    3. pip install pdf-craft" y; f+ Z1 n% h' R" _
    4. 把下面的内容写到一个文件里,例如 a.py, n1 F$ ]5 J8 ^8 e7 k

    # w# U; t) z4 R1 H
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter$ j7 q. f6 D* N2 a8 }2 T* ^; n
    2. 8 Y3 {( s8 Q  g- w* V
    3. extractor = PDFPageExtractor(1 S+ G% c2 g4 G& {! D: ?5 h5 e! m2 ~
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.3 H" Z1 Q- Z! z9 {  Y) \" n4 I- C% j
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      4 }, e# Z; }8 G0 M$ A1 D+ y
    6. )
      8 Q) `* J  o( t6 B% i4 J
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:: y. t$ B5 N3 m4 Y5 G+ h! x& J, O
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):; c/ w$ `( K) B# f5 \6 n* X
    9.     md.write(block)
    复制代码
    7 o; i$ g3 @. k
    1 [& l4 N! @- Q" Q
    要修改的内容:; |/ a: P/ u& f! m4 p! z
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    , O& p! }+ f  t" h4.2 markdown_path:输出的 markdown 路径文件名: o1 g6 z2 g5 g4 m9 i# Z( n1 h0 f
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    & D; b' v6 F6 Q
    % m& {. R! u- i' n' M+ X5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 8 r$ [  I8 b- U) \) a% A
    * w+ r$ i; A  L7 r% Y, w) E5 D
    目前为止PDF转纯文字的最佳办法。
    / x( {3 q, j0 q" {8 L( `先写个小程序,把PDF按章节切成小的PDF。7 l, |. }; j0 L3 s& i
    然后,把PDF一个个传到deepseek,让她抓取,除错,输出。" W. m3 Y: N  w; U" n4 K! n
    效果非常好。
    / j/ r# m9 O6 R( p! g, I6 m
    ) f" h: b) V6 a& c- u9 l4 gdeepseek,qwen,chatgpt 三个,deepseek是最好的。2 ?/ O/ t1 Q* `, g& n
    & f( Q- u5 i/ h$ q- K3 T2 ]) I
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    ) {' C% H& G" |* n! O而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。! O& j0 x% G" s  q% I
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    7 J9 Y+ Y3 G5 \/ h
    ( B7 K+ S+ s9 `1 H$ aAPI到目前为止,差强人意,不如网页版本修得干净。
    1 i- \9 a5 R( ^7 s' K7 u; Y/ i9 D& R5 e5 H  b* Z/ E
    deepseek可以同时开四个。
    & r, |0 f3 C0 n7 v- [( H' Y! c

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    . V% T2 }" @% F5 x7 w
    4 k% K7 d% x' Y7 P% C让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    2 ]% C/ k" W1 ?9 D- _让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    & Z/ h% u5 x. O" ~/ O8 |/ d2 b细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:334 s/ H# v  |$ O7 C# U
    细说一下,听上去很不错,多谢。
      ?: r: H! w4 q. f9 ?) X
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 . R/ n1 k" i" |1 D

    & }. v; t2 I  l7 h6 W+ A, F已经搞定.& s; h' w3 ~, H% i9 `1 a/ g
    4 a, e" N. U* }2 ]- d2 D- P
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。% R6 n; x. S3 k- c  v

    1 @; |( H! V$ T. ~" y# F9 r1, python + pypdf 按章节拆分小的PDF
    # v& R( ?# P" w4 O: I( G
    , j+ }! m% l. s3 ^, ?5 Q: ~2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile" i! T8 t; [; W, q$ O% U+ a- B
    ' z+ @" w7 I1 r/ {+ @
    得到text file
    ; \/ U+ \4 T5 Y% K" {# M2 s# ?5 n8 K. `$ u; d; b+ v
    3, python 读取整个outputfile,丢给deepseek 矫正。
    0 {! j% [* H" o* p0 Q0 S2 H. Q1 z" O+ @' c1 S
    模型是 deepseek-chat! z( Q3 ~7 v0 v
    ) m" {9 j0 u4 d% z
    max_tokens 最大是 8192,别的不用改。  D, V/ j8 G. B/ B! S& [1 C
    0 c4 r  ]) i! p% T( ?6 p0 z1 D
    参考:
    . @# [0 I/ e8 F# a% khttps://api-docs.deepseek.com/api/create-chat-completion
    , _4 k$ z, g3 ^; E& `4 q
    % K) ?: p& V/ f% y" u4,费用:
    & E" n. ~3 Z; d9 ^: z( k
    7 }6 {7 t3 g& ?实测:
    $ ^+ S, e2 w) O4 F! T: T3 K
    0 Z7 k" O( X* U: F1 i( O/ W" K296K 字母,用了 9 美分。4 l1 G4 e4 E' C: X1 _4 b

    0 ], T5 F( m' e! F% r+ P4 D英文字母 到 token 用量大约 1/3
    ! R" ]9 k% t( C2 q0 G0 A/ V
    ( T5 V- h9 \2 F+ k; `tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    3 V, p! |% [$ A! i( Z( L
    9 g# B: }) a% ^  r, P# z7 s8 |32899 个字母花费 11782 tokens,包含输入输出的 tokens0 e5 ~/ a2 h! Y$ [, v) Y5 }3 R

    ) J+ [* x% C! q" ?8 y价钱,非常非常便宜了。  Y" m, x- j6 D5 |! D
    7 c) k9 Z- f3 f( i8 B$ C7 N
    参考如下可以计算,懒得算了。* p! O0 @" l( O- v3 i9 i8 n
    & N8 B9 x& E% v9 _
    https://api-docs.deepseek.com/quick_start/pricing
      f4 ]) X4 g. m' `8 Y4 j  q
    8 _! m7 D* f/ ?+ q5 s  p. P( [7 B% }1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14- h* O( q+ O! ~" r
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    7 R# ~; h4 q' D! A5 s2 G1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    7 r" G" [7 d8 s  t. Z. D4 U8 w
    5 h  j+ y* H0 s4 W1 Z5, Balance- K8 R: t1 f% _- R5 r1 r+ S

    + A& o. L5 A; `: V& n: R) `, |% x可以在程序里调用,知道每次运行结束后,balance还剩多少。+ n( x: o( p0 n& k/ Q
    参考:$ p4 b2 ]/ m( z% \1 f
    https://api-docs.deepseek.com/api/get-user-balance
    0 T4 @, I  I7 Z; I% R
    , ?# A& [" C8 P8 l1 k1 p8 K  }6, Models
    3 P, j  Y/ Z/ O& X, T. r
    ! w0 L9 p) }- X' ^. O目前就两个& \7 B$ U9 F; Z7 Q
    # deepseek-chat2 U$ U. C) a; z) T# d+ G% }
    # deepseek-reasoner) T! z, N- ~( O3 b, Y
    - x/ z/ n. }2 P: a0 u
    参考:
    ! A! h6 |, t, Lhttps://api-docs.deepseek.com/api/list-models
    # l9 u: l8 Y5 I8 t+ A- {
    4 U/ M* S9 t5 P* m5 l- o9 E* U! d1 `5 y% `
    7, 问题: U5 K  {; E7 P

    8 R1 n) \* T- Z  v% r) Xdeepseek 会将前后两段合成一段。
    + y; _+ n8 r; c, t- w7 d  @8 ^特别是那种大量的对话的段落,deepseek会给你合成一大段。
    1 s" O9 [( ^" l* I/ A
    , E; C& L4 L7 r; Q8, 钱说了算。( E2 ^" N: L# K4 g
    3 i/ A; n7 [" v- T* J5 i( c. W: z
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    , y' O, M2 P8 a7 G3 D但是API就不会出现这种情况,毕竟我们给钱了。
    1 y7 O9 `! s0 g1 Y2 q$ y3 n6 Nchatgpt也是这样的。
    $ m1 [! _; ^3 F/ \# [+ \9 x$ J
    & d8 p! e6 i1 G8 d# U
    1 |6 m" ~9 e: k+ K5 m7 E

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-3 00:59 , Processed in 0.071918 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表