设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3696|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
, ~& W* q1 v$ r4 g# X  T: \& z' n1 f( {) C  e3 q* e
把PDF上传,然后让他抓取文字,并修改可能的错误。
8 f. h9 A1 N2 q' x; B+ b. x然后deepseek完美的完成了任务。- [5 a7 F; }% g* v
段落清楚,列清楚,页眉页脚全部去掉。
! f* X+ l- x2 K/ ?! z, k% m6 B4 b8 |我要疯掉了!, W1 E. |6 I0 y: [( |4 C3 v
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!" ^( m& b. v) S8 \2 K7 y% B
====
! V9 k8 g( Q  Q% \  j/ q; a% `中文也很完美。4 z9 r9 |4 i" ?5 L* G3 [
经验值,每次十页比较稳定。/ {; [! {( v  P+ G  Y& F
现在我这里API还不能用,等恢复了,全自动了。
! Z' p& ^: e! n====
! h8 N% e8 q% |6 T第二次疯掉了!" i% v3 `$ ~$ h
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。( N9 p9 k6 w8 C
====9 s. }" ?+ ~' {
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。$ m& {' G: r2 h  Q+ Q1 O
但是任务多了后,每次翻译的页面数是减少的。
: n* P" T8 b3 O) }! r$ X; D0 ^& K" o好吧,我五体投地,继续探索。( r( D% S+ ^9 T
====
5 a1 S' r3 v. b; u# x2 \为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。- W( l) O$ c& {8 p, M
====% h% n: y# }. t+ L+ ~
好吧,有些东西是不给翻译的,哈哈。
; x" J5 x+ B$ @% b5 Y; c/ @
3 b8 g7 k0 D% g2 USorry, that's beyond my current scope. Let’s talk about something else.
" z2 _: ^% U7 `9 J. g8 S====
2 J+ }, W/ M# E! q9 |然后我的英文命令也让deepseek 帮我修改,呵呵。
4 h: k- C" X3 \% C====- Q2 |2 P& |# |) F- }/ L
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。3 ^1 b# H6 ^/ N4 ~# e
====! L! f3 c4 w  g* U9 i
时间段的话,北京时间的下午和晚上用比较好。
3 f1 K+ D% m. ~后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。# m8 q7 z% \% V* Z" m# I
====& {) n! m7 Z$ E
用千问吧,非常稳定,非常强大。5 U) b; \1 l! \+ q& c8 o9 A
https://chat.qwenlm.ai/4 w9 z; `' _5 q& n# K! s9 E
====! E1 I0 \3 L5 z% Q
Deepseek,API 看上去可用了,但是不给充钱。. p+ M! |% B8 `# C
: U+ l9 v, j! n# d3 `5 f* K
, m6 \4 q1 t6 G0 m

( n8 C/ K5 G) G# W9 d( L  l

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3888 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53$ c! R( A8 [+ L" ?0 ]
    这功能很赞呀
    : n+ _6 o$ p0 M, J5 J& a! B7 A
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13( G8 @2 e  S; ]; M+ H  w+ S1 D
    有没有上传整本书试试
    / T6 t, s( U# B5 e0 k
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3888 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    / C8 E# u9 P3 v( O8 R* e3 _& A
    & O$ y, Q/ P1 s( ~以后让deepseek 读出土的竹简8 |2 m; `# r" f9 k2 A3 ^6 S

    ; U/ v7 w% c# ~  `$ {1 Q还有把古文翻译成现代白话- L1 {3 I  ^$ x- \% g2 h7 V

    ! z# C5 c0 W! o! e" g以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    昨天 00:41
  • 签到天数: 3049 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?9 O4 L1 ?+ [8 ^; I% x! _+ B% ~

      @, d1 d* A- H5 [我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    9 p# `6 U; k8 _  ]请教是如何实现的?
    $ q7 X, U1 c' Y  K/ m$ U6 a7 i3 q) _: w: m7 s
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    ) B2 t9 Y5 A. n; T
    5 x. ^( }4 e: C" ?我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。* a( P  q* q0 J  _1 k: c1 g1 Z' P
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。6 N: T6 A' H' K$ w6 x
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。! o) ~! I2 V8 S( r; Y

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23% G! B0 X8 h. \; d/ H
    请教是如何实现的?: @. l9 t2 d$ |% S) ]. z6 L/ x

    4 Y1 L, B& X" K) s) R我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    ) O5 T0 O' P$ {% U) K
    https://chat.qwenlm.ai/
    + h9 g- U) b9 n* o! w/ y. S试一下千问,估计美国人没有攻击他,所以资源敞开用。
      m% k6 a& f  q' j' ^- ^很稳定,质量不错,好像最多一次处理15页。9 D4 u0 _7 n: y3 b
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3152 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。, h& Z. {0 S  F
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。4 S6 @  z7 Z" I; x
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    8 j1 i3 t" v8 ]( Y7 @$ v6 A8 [+ i3 w1 ^; e0 k
    https://github.com/oomol-lab/pdf-craft" u$ T3 y0 ^# w1 K- V. ?, q
    . {" l! {1 ?! ~% _3 _, ]
    1. 这个工具要求装 python3.109 `0 z8 u9 p0 h& \. T( ?1 m
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    ) m. Z, k+ G4 \1 l3. pip install pdf-craft7 f: [' `5 u: C/ D
    4. 把下面的内容写到一个文件里,例如 a.py
    ) N' B, w1 }$ q- v$ j* p  ^  [, I3 t6 _# N9 V$ d# P
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter; v: T) k( D: }# ~& C7 S

    2. $ _. M% x/ Z% x% A
    3. extractor = PDFPageExtractor($ ?8 S$ _% d/ `2 g( Z+ Z/ [
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      ) D+ e) v2 ?5 g  A% H6 t5 e5 V, h- N
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      1 E2 a  T  F5 Z  y
    6. )' b& k0 u1 c/ S+ x6 l* a2 q' Q, R
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:/ s3 w1 F* E! a, M
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      % u2 d9 c1 _: a) Z, U8 w2 ?, O
    9.     md.write(block)
    复制代码

      x; [) [7 w" O. }) b
    1 k4 n& V% {$ B- Y要修改的内容:* X2 H9 b8 D4 t7 [6 `
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型8 j+ B  B4 d3 [5 x; d* x( O
    4.2 markdown_path:输出的 markdown 路径文件名
    7 t3 p+ }0 l, w  x1 i4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    & p' Z: `* G! Q8 h& ]" G6 i2 }1 d( ?* D5 u
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    " A: N# h, S+ u$ O( Q8 [$ {4 k' k( z
    目前为止PDF转纯文字的最佳办法。
    6 M3 H" ?# l" P' Y$ i. i) z先写个小程序,把PDF按章节切成小的PDF。
    7 J2 G) f2 w$ H1 x5 Z# ?然后,把PDF一个个传到deepseek,让她抓取,除错,输出。7 H% X: n# E+ Z
    效果非常好。
    8 v' w% M; u5 ~8 l0 u: s
    3 Y+ U: a# p5 m0 _6 }$ Y/ bdeepseek,qwen,chatgpt 三个,deepseek是最好的。1 Y/ b4 z* Q! W+ `1 p4 M& }+ _
    4 c4 S4 t. Z, ^6 f4 `" m' J& S2 e
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    $ }2 h% g4 V7 Q4 b* F  a* z而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    - x# M1 A4 x& S- x我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。3 P+ @) Q, B2 ]4 l# ^* g

    3 E' l3 k! z: U* m% G# B2 HAPI到目前为止,差强人意,不如网页版本修得干净。
    $ j: D4 V! K. O5 w8 u# A: ?/ T& p
    ; `8 t) p- h# T; hdeepseek可以同时开四个。
      J, B' P, i* `& }

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 5 }9 D9 h  V9 g0 }4 F$ |$ \: H8 P  d
    ) ^0 [8 H4 ^9 E$ Y
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    + a) H* t3 x8 e. L4 z% [7 m让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    , L; d$ v; ~# o6 l2 L6 h' K细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33$ x' S5 \1 A! k3 g2 R+ }
    细说一下,听上去很不错,多谢。

    * K+ E5 \8 D# E% ^) ^4 b直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    0 {7 v1 h" A# z5 ]5 m" W# o- e# R& l' n
    ( d! v( v% M2 U1 k已经搞定.
    2 c4 i8 }' \0 b$ V
    + h9 l9 o. A% r2 s首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    2 u; y: W. t- {# f/ [4 K6 j5 n
    ( n, b: L3 a* x: b1, python + pypdf 按章节拆分小的PDF( s! a4 |1 f  l  b

    # n4 f% l( b% O% T7 Z9 Z/ c7 Z) T6 k2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile: `  N& L1 p' `* E/ ?9 S

    / t2 U0 ^/ H; r' O  @6 E得到text file
    ) c4 g0 X, n( ?8 ^$ [) S3 v  W
    3, python 读取整个outputfile,丢给deepseek 矫正。
    5 Z6 L/ b6 A' ~
    " W5 h+ k9 v: T3 Z模型是 deepseek-chat
    ! |2 Z) S  C. T8 X6 O! b! s- k+ ]9 M8 F/ ]
    max_tokens 最大是 8192,别的不用改。
    5 ?" H* n3 w9 n( W
    5 x5 ^& g( r$ b  ?参考:
    . S+ L8 E9 ]! L6 Bhttps://api-docs.deepseek.com/api/create-chat-completion) }( H. Z" Q2 |$ n. ]* E: H

    * k( W3 o+ C/ h9 o9 P1 O" G4,费用:) g0 o0 n5 ?8 D: p1 K
    ) V7 k. p- u  [6 O) B; E$ K
    实测:7 R- e+ p2 u- \5 s2 O
    * W" G* W/ N# k" U. P6 j& _% S; s
    296K 字母,用了 9 美分。) R8 M! N# Y3 J) a1 y
    , l5 }6 H; d& _) k/ c( l
    英文字母 到 token 用量大约 1/3
    & k( I) f( U0 D* _& @  x% P8 @7 X+ j; F
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    : Y9 A" g! y& s4 S
    9 ?, z1 u5 |( ~; A5 M# P  e% p32899 个字母花费 11782 tokens,包含输入输出的 tokens: P1 U& x% i& {0 Z
    0 f! d1 U3 h$ w
    价钱,非常非常便宜了。" c7 [2 X4 d3 K) l7 a6 h% ?

    5 c0 G' r- G" x" M- p参考如下可以计算,懒得算了。
    0 U- p" N  F8 L, D
    & b. G2 a# `3 J. n! Phttps://api-docs.deepseek.com/quick_start/pricing( b2 W$ n9 J& O# b. n# h0 I
    3 O2 J2 {5 z9 R& c
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14: c: K& ~9 X% Z
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    0 c& T1 G3 P& }/ V* Q' o) s1 z5 }1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    4 D/ N* d; e  w. g! j; \) o4 z
    4 E) E" _% v' |& X5 E. S# T5 O5, Balance
    / ~2 K+ o5 C# v* }. W
    $ l% b  [9 s2 ~5 `可以在程序里调用,知道每次运行结束后,balance还剩多少。/ }1 D. j0 E# c( L
    参考:5 e4 X$ ^& ~9 C% L
    https://api-docs.deepseek.com/api/get-user-balance* Y" O4 b3 |! D* R( O2 T
    ' {4 U" K& k) B" `0 t
    6, Models
    6 x1 H! K: a6 X$ m6 M+ I
    ( z8 }. y' p9 K+ N目前就两个
    + k8 Q6 I6 F. {: l5 t" y( j# deepseek-chat& l! D1 l$ i. s, z/ M8 E* E
    # deepseek-reasoner
    / s% i' C7 n" v/ ]' z1 }' z6 E. ^. Q* U9 [2 G
    参考:" u4 B% L9 J% ]# u0 g3 q; o
    https://api-docs.deepseek.com/api/list-models" C- k+ q# ~% D- \- k% s! h
    & Q" z/ M: k/ F8 y5 v7 D8 `
    ) C- D6 o, s& C, f
    7, 问题
    " m# ~" Y1 r$ d: M- n3 J4 r
    5 a+ W/ ?7 K. {; G, h: ^deepseek 会将前后两段合成一段。: _6 E# y1 H: ]: n; i3 }. V" F1 Z
    特别是那种大量的对话的段落,deepseek会给你合成一大段。+ H2 h8 M) v- Z+ N- I: n- M

      Z) q% r/ M6 N4 X8, 钱说了算。! |5 t" q; v; N8 |( [+ {
    $ ?: u& S( ?3 J9 H* J
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    # Z( k" c& f" q! k$ C5 s* m0 s- W但是API就不会出现这种情况,毕竟我们给钱了。
    0 M/ s3 B$ o) }: G( dchatgpt也是这样的。; f; @! e( E# S( h

    $ p$ a) s7 R6 Z3 G, ]+ m( }: A& K. S; \& ^

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-8-28 13:54 , Processed in 0.068471 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表