设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 4104|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 8 s9 l6 d# w6 B2 y

. `! C( C8 o* S* [( q( k. i把PDF上传,然后让他抓取文字,并修改可能的错误。! Q0 `2 P% T" ]4 s5 L% T7 A; v
然后deepseek完美的完成了任务。
. s+ j- w3 f! ^# E段落清楚,列清楚,页眉页脚全部去掉。
# S! `# N2 d8 D/ G  G( c我要疯掉了!8 z  R& [7 i4 m2 K: e# k
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!$ R% i! W& x: _0 X/ A$ {/ @- r: |% F
====
$ D  [# q0 x% w4 M中文也很完美。
: I. V5 G5 D/ S0 _7 u经验值,每次十页比较稳定。
# e! e5 U, f% |0 c- C) w& q现在我这里API还不能用,等恢复了,全自动了。
$ {/ ^1 k" V, m3 b0 z* h====
6 F, \3 \2 {$ a& g/ K6 Q  {第二次疯掉了!) u- S2 L; x% x% z3 K
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
1 n; y4 H! ?$ Y) |2 C/ O8 V====
+ ~7 Y7 J: M8 ?8 m! Z现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
% l2 A! f  I; m4 B但是任务多了后,每次翻译的页面数是减少的。
0 p: V3 {) {) L$ H+ O7 y) W' t好吧,我五体投地,继续探索。# _# _; p% F7 @- ]' N
====7 ^' {  [6 t( H( q) B2 d
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
* D3 @% F" y0 U$ S# ^3 w, J8 c====4 W0 @/ ~( Z  i$ N: n  m& g
好吧,有些东西是不给翻译的,哈哈。
& ^% m8 b% N% b0 [) A9 A" A4 W: Q1 |1 L! v. [" L
Sorry, that's beyond my current scope. Let’s talk about something else.; x' }, P3 C( Q2 a0 Y6 b
====
& i. V9 m) v$ V( s- J然后我的英文命令也让deepseek 帮我修改,呵呵。
  G0 U% M: R$ s& m====
& C( i3 D. z  v9 y. ]日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
* Z4 ]1 t! ]( Q/ g6 a9 d! d3 z# c- t====
6 |+ c! Z$ H& z9 F时间段的话,北京时间的下午和晚上用比较好。+ \7 O4 `, j' X$ F! R
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。. h1 _7 g% ~2 M+ X) v$ @& \9 g2 h
====. J4 S! F4 e, \2 Y: E5 T  P
用千问吧,非常稳定,非常强大。& s6 A7 k5 s/ H! i
https://chat.qwenlm.ai/3 I% N: P6 J: v9 U& y/ }. x- I9 t
====/ _' [. R# c! }. f, \/ z
Deepseek,API 看上去可用了,但是不给充钱。# G' ?* S6 y- S$ [: s4 y% m. S

1 K7 \7 N7 H9 R$ H  h7 V- i" [. ^0 N  S( Q' A6 g, I

; |" T8 g( b2 g( U2 b

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    3 e, K+ b: m0 Z- Y; ~这功能很赞呀

      Y: {8 ?8 W3 Y- a  v* Y% H简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    衰
    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13
    - W! M  ]5 p0 l  v- T: ]有没有上传整本书试试
    1 \0 N, @. a* ?) ?, R
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 . M7 c) m8 ?8 M; q
    2 t- \& X! G$ X0 c3 R
    以后让deepseek 读出土的竹简1 Y' R# G8 z9 J4 p9 _+ l  e

    . }5 ^7 Q" V9 w9 V: Z还有把古文翻译成现代白话
    8 R5 M( ~0 |- a. G. t5 d7 u5 t$ C
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    2026-10-2 18:41
  • 签到天数: 3071 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?' x* \( f1 S% f/ e! O% h5 F

    6 K3 s: K6 T% M( A$ x1 ^我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    ) A. d+ u; a2 v4 I/ B( X& b请教是如何实现的?
    ! ]+ ?* W# x: e4 U( y7 O# t$ ~" F8 Z) Y5 H) Y* x0 q
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    . X/ e7 m5 c( k8 F3 Y: I
    " T0 ~+ M( O( i8 m我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    5 d& ]5 e$ M. N( m( v! \, w文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    ! b. ?  P' I$ u美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    + g+ k& Y- T# \9 a  ?

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23; ^3 N' E0 j+ P2 b7 i) i
    请教是如何实现的?) Z& f9 \4 f$ U0 u
    ( }! e; u2 q$ M* h% n$ b' O9 n
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    3 {$ K4 [$ I  ^https://chat.qwenlm.ai/
    3 L- T3 E, F: _. e+ u试一下千问,估计美国人没有攻击他,所以资源敞开用。0 y: `" [1 N" k: m3 t' s
    很稳定,质量不错,好像最多一次处理15页。
    . L1 {9 I' O4 V7 a我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:03
  • 签到天数: 3177 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。0 X. y! W! R! [( x9 F; a! L
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。0 d4 `* j" p* B* `8 h% Y
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    , U8 |$ c( f1 k: E1 F  x
    % o9 H8 `# o1 P# ahttps://github.com/oomol-lab/pdf-craft$ r+ T) N. B/ m+ n

    # o2 `2 @- d; ?+ Z* s2 G' A+ k) r1 p1. 这个工具要求装 python3.10
    ( M2 n$ i7 J; h7 U2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.00 z& z" s3 U& b& E! A
    3. pip install pdf-craft5 h4 b, D4 t4 v3 M9 @. r
    4. 把下面的内容写到一个文件里,例如 a.py) S. Z# Q7 h! ]0 ~% R
    # B) ^) Y* ]% S+ X  g9 q; t# a7 {% D
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter( D3 E1 x( ?& @

    2. 0 L) U( ]' J6 h+ }3 j
    3. extractor = PDFPageExtractor(
      ( p, r5 K0 m) b
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      4 T2 |5 S, G) E3 a4 X( G3 w
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      + r- O$ c. [: \; _
    6. )
      : U  Y4 G" n1 l& o# H7 I& _
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:3 N1 c& K$ B' |8 T" @/ @0 ]
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      , O: p& @+ \# U1 N. ?
    9.     md.write(block)
    复制代码

    + i  B) w0 g8 }* x  d" j3 s1 c$ d
    要修改的内容:
    1 k. v  v- ?9 V. R, Z, w4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型" u! I. G. ~8 n  w  W
    4.2 markdown_path:输出的 markdown 路径文件名4 o0 a  l( S  P& G7 D# X! E8 _' r
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    1 `7 l0 N3 c" ^% ?& ~6 j3 Q
    - T3 P0 `, B5 J5 R3 Z5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 5 s$ i* {* n+ M0 X
    / r9 Z6 Y, ?) N: K# z6 T
    目前为止PDF转纯文字的最佳办法。
    ( w. \8 M6 k6 O. L  N: _& F先写个小程序,把PDF按章节切成小的PDF。# v* N7 ]/ w% u4 l' X# p" l) m
    然后,把PDF一个个传到deepseek,让她抓取,除错,输出。3 W7 b; V- ]: k2 {" V
    效果非常好。
    : O+ T5 R, n7 I* i1 ]: y4 C+ f; P2 }: D
    deepseek,qwen,chatgpt 三个,deepseek是最好的。
    * U* D1 q1 H- ^# E% @' s" i, k
    1 l% a3 i- l) ^deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    ' ?" r5 R% n, q. ?, h而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    - f7 g. ]( t5 p. n+ o" y( s) e  U5 C我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。1 }) V0 j) b6 G# n5 c
    + Y! i% l. o  \7 [4 t! d; b; P
    API到目前为止,差强人意,不如网页版本修得干净。- _3 R9 M3 T( o4 g/ J/ |

    , {5 T4 @7 \% |7 a0 c0 rdeepseek可以同时开四个。
    # x6 e& U4 |3 k' X1 T$ q  B( W

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    $ C0 y: R( Q: d6 B4 D- |& b9 J7 @- d; {8 d
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    5 x' q# V: I* X让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    0 @4 q# Q- r: L8 V, `- `8 h" x细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    ( K5 p9 J& _: h+ I- J细说一下,听上去很不错,多谢。

    $ Z& j3 u6 {3 Q( b1 G" b直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    , B# l. x4 D% A9 [% x2 n8 S9 u& G0 L- L0 b& N
    已经搞定.
    ! O' O; [- c1 Y% h6 Q% I
    9 t' k- i) Q$ c% [6 v# @# N首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    1 {" }) x' r$ ]$ O$ O2 ?0 S
    ; f3 i1 s! x$ D. ~  A; i1, python + pypdf 按章节拆分小的PDF
    + B- i4 t! b9 k5 @: S/ q  K6 h( h# J& x! H# u3 _- n
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile) ]) |; l' k( ]5 g9 v4 i

    . s) ^6 \+ x; E" j9 P得到text file' f& J9 B# C# q$ d
    # z6 W* m/ p; I
    3, python 读取整个outputfile,丢给deepseek 矫正。, K5 V1 c8 y& f& k
    ; z+ G0 b' S7 z5 P
    模型是 deepseek-chat. C+ i) k7 e# h

    7 L$ r0 i5 I; D, U% G& f3 kmax_tokens 最大是 8192,别的不用改。
    ! h* n) d/ @7 Y/ N$ O
    4 U/ l  }6 d, ^" O# A" K* x参考:
    5 I& z9 p* a- @* @' Whttps://api-docs.deepseek.com/api/create-chat-completion- ~; H2 c0 \/ D6 ~" c# _6 K3 n4 F
    # S7 j! y$ T$ x  l$ N+ z* C& q/ b
    4,费用:
    ' S* @6 r9 c- T3 E+ [, V) j+ }8 T' Y0 t: Y( |, n  ^( l2 d
    实测:* Y6 ?. |# R% I

    ; y( \; ^2 Y0 i2 g296K 字母,用了 9 美分。
    ' v4 |5 Y% S6 e# A/ x# I1 Y. ~# b2 A- E! N" b5 f4 n9 J
    英文字母 到 token 用量大约 1/3
    8 Q9 J* l9 o* j5 v1 g2 ?: {& w1 c% F( F
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    ! H' W9 j% c- D* N
    $ T: {6 T4 M% p32899 个字母花费 11782 tokens,包含输入输出的 tokens. s. A  T) N* f* L  z) \  b
    $ g5 T6 w% Y& H0 F& a& X  O% ~
    价钱,非常非常便宜了。) W7 q0 B2 y- D& Q: z, y7 q

    ( w% I7 o, @  Z1 d7 v- l参考如下可以计算,懒得算了。
    ; N( U  I3 ?# z0 s( |7 s3 m0 G8 }5 t- R
    https://api-docs.deepseek.com/quick_start/pricing
    1 h' [3 M" ]; V5 G
    : o" @1 }9 b5 i# ~7 }( x1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14( e+ a: j3 T- \& f
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55* w2 h( n5 \  D: [/ V* t4 c* v
    1M TOKENS OUTPUT(5)                                              $1.10                $2.190 h- Z. [8 r- V% P8 ~1 D/ |
    % N& D$ _& [2 O9 H1 u. K/ y/ U
    5, Balance0 r3 c2 X$ H4 s: H

    ! a# K. u9 C$ w( @; P4 M可以在程序里调用,知道每次运行结束后,balance还剩多少。$ v7 N0 Q/ d7 W
    参考:
    $ g% c9 V, i' A+ R7 n+ X  F* \# Shttps://api-docs.deepseek.com/api/get-user-balance
    8 ~" }' n+ B/ \3 S0 q2 b. _/ ?4 D) R$ i
    6, Models
    + B; L4 ~+ @, e9 U' S& o( {1 i3 A, r" G5 I# X
    目前就两个3 `/ {6 D% C- g5 U) c+ {
    # deepseek-chat
    : D0 Y, ?, P( g6 f, `9 r( w# deepseek-reasoner5 L7 o: _. f7 [3 F2 U- U( M1 ]
    & D# C1 a& b$ t3 l! `2 l% X
    参考:
    ' O7 X" p" Y9 Z9 l, chttps://api-docs.deepseek.com/api/list-models
    # t6 o: U- S  [/ r1 R! `7 O" P+ u
    . @* ]1 V$ l8 x* n
    " K$ J' @* M% }! @3 L, p7, 问题
    ( _5 c. G1 I  N' f. m4 {: a6 Y9 x: h3 A% Q( d" O
    deepseek 会将前后两段合成一段。% u6 W7 u2 m& S3 R1 c2 E( n* O
    特别是那种大量的对话的段落,deepseek会给你合成一大段。
    ) ^) [, w# T7 S9 ~2 q8 Z/ S& a/ p8 r& o) g) K
    8, 钱说了算。
    : @% I+ Z! P9 l5 |" q1 x
    9 J( J  ]5 q( |5 R. o& A% Bdeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。: P/ k3 S5 n& ?, y  W3 ]
    但是API就不会出现这种情况,毕竟我们给钱了。
    ! s# f2 v) Y4 R. u& I% R7 _4 nchatgpt也是这样的。; u  m) E3 A6 p  z" z
    " i& D$ R1 _5 D6 G% {- b- {" y
    / e0 q& b7 W. ^! r" a* s4 u$ L

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-10-11 05:26 , Processed in 0.064711 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表