设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3938|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
$ l8 ~5 ?9 k0 E, ^' W+ B: u/ A
  o. r$ y! d0 I& H把PDF上传,然后让他抓取文字,并修改可能的错误。
$ F: Z1 z9 p# T, |5 S. r) M然后deepseek完美的完成了任务。) E9 C5 C1 Y% N7 b, t
段落清楚,列清楚,页眉页脚全部去掉。
& ]! o! O. f$ K# `# H5 G7 h) q* Z我要疯掉了!
8 p! V1 ?/ y  r$ c2 d* n+ R1 F赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
4 e; C, _8 Z9 ?0 Q====+ x/ \' ^1 o5 v8 D* `5 _5 @
中文也很完美。7 D$ ?/ q. Y: O4 `" w8 D! x
经验值,每次十页比较稳定。
9 ?! [0 s  u. [现在我这里API还不能用,等恢复了,全自动了。
# L, j$ C* W& F' Y) f! l$ l% l====
, Y3 a# H- n" I4 r第二次疯掉了!; Q; a* }/ Z5 ?8 y$ i4 R, i4 c
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。6 {, r+ Q; `/ E) l4 S
====
& f, o. q( ], h' t# C5 l4 {5 w, p现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。5 Y9 Z9 I3 [- w: K# t9 a2 B, q
但是任务多了后,每次翻译的页面数是减少的。7 O( R5 D* I5 g
好吧,我五体投地,继续探索。/ p- k. W$ ~& p0 Y) C4 s9 o
====
7 ]% ~) y$ L! ~% f# F# L为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
1 @' ^+ l  X  S2 n$ ]7 E8 m, o5 ^====
6 t! D% }. R7 c9 t好吧,有些东西是不给翻译的,哈哈。4 v+ z1 E0 L2 H1 e; B, S

5 ]# T9 D3 x/ \Sorry, that's beyond my current scope. Let’s talk about something else.
5 O, D- t6 l/ z3 u5 O9 L====
, [! D/ H' z! k+ b. e. F. c然后我的英文命令也让deepseek 帮我修改,呵呵。4 _5 F' D& @( y- {
====
7 ?# B( w; }4 u日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
' h8 k; q& X* V====6 h9 R* u, {4 ]  a' q
时间段的话,北京时间的下午和晚上用比较好。- ~# H+ w# N+ B. O6 W/ I* N
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。  ^3 p, ?0 t% b9 d1 T
====7 p; `9 X6 L( y. I1 G
用千问吧,非常稳定,非常强大。% n4 v2 G* @! c% D
https://chat.qwenlm.ai/' z* r6 ~" I% B2 N9 u! |4 d/ B
====0 o: S! [' k& T0 g0 `% _6 N) H
Deepseek,API 看上去可用了,但是不给充钱。5 s9 }& T' y1 f  j% H
  H8 z; z/ F" v0 Q& y  k3 c; v

+ N$ K, J4 @# ^. C1 V* x8 s( D; C) o, i- M0 \0 s1 D

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    5 小时前
  • 签到天数: 3911 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    6 h" f9 s2 E5 Z8 s2 x- j( M8 M& }  G这功能很赞呀
    0 ?/ l1 x+ G4 E; G
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:135 Y$ I3 K& R+ N& m' M- i) D- M, u
    有没有上传整本书试试
    0 C) e1 B& [% w7 s) F
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    5 小时前
  • 签到天数: 3911 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    9 T# r5 u5 j! s. I( O, U" T
    / q2 ?" A" V5 S! x- h. b以后让deepseek 读出土的竹简% g: r5 R# R* z- u7 j/ x

    8 a  y7 U, z- w* l3 O2 W还有把古文翻译成现代白话& T5 P" h6 o% Y
    + S; P2 l- j0 D; H- I4 B
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    昨天 18:59
  • 签到天数: 3067 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?* ]( L+ ?% a4 `

    7 I" o* D; m3 D6 I! g5 @我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:237 c2 ]9 R  A3 A: q
    请教是如何实现的?! y- c+ T1 y: V( V$ Z' x

    ! [& A2 O0 p4 u我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    % L% v) R- q8 F' a0 {- v

    ( w8 B. S5 y2 D5 [* e我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。# \! z) n$ ]: J- x5 L) O) r
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。+ B1 W9 Z& v" q: j. P: C' _
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。  S/ q' J8 c4 K. {) I. R; l& K3 t/ w1 o

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23: m+ f- M) a! e7 R4 W! I. h
    请教是如何实现的?: Q5 c  H: t0 S- H
    ; m3 M, C% a; K, P! t
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    7 U* j' ?/ v# S4 D# Xhttps://chat.qwenlm.ai/
    & c5 U  i+ Z+ ~2 D0 U0 I' x试一下千问,估计美国人没有攻击他,所以资源敞开用。% n: l+ q) x: K% P- @9 k& A
    很稳定,质量不错,好像最多一次处理15页。
      i  A2 T0 y0 q0 m我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    昨天 00:00
  • 签到天数: 3173 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。9 W8 ]: {; }4 _# f) p4 h
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。+ f5 ^# X5 G0 t* n
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    % d+ u+ r& }! u# ~" T' t& \. J$ y: B- l/ E' V8 h
    https://github.com/oomol-lab/pdf-craft0 r; X) k$ V8 Z. s: ]( N
    ; J) R; u3 L, k2 Y/ |$ i3 N
    1. 这个工具要求装 python3.104 g0 b5 H9 X  p5 K) F" s
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    $ Y/ M4 I" J! g" S2 s* ^3. pip install pdf-craft! R2 i1 B5 v# i2 s3 ?
    4. 把下面的内容写到一个文件里,例如 a.py" a/ X, N& V, D# Z% g

    , \" r5 Q3 A9 M% E1 P; q4 E
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      6 M% |5 T" n3 X6 @' m
    2. 8 k: j3 I8 v( k  n) ^
    3. extractor = PDFPageExtractor(
      8 T/ Q1 K* M+ c" \
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.. b$ N7 M& u7 R  i
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      1 r  b8 a9 N" y+ O  Z) _1 G
    6. )
      ' K9 \6 Q! |/ ?" g7 B
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:  F, E9 C8 N: ^% [) }
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      1 h2 H/ o6 r* U! P& s( D. Z! o9 K
    9.     md.write(block)
    复制代码

    4 Y/ e2 s6 @2 V+ a0 g2 |) [$ _- q* k
    要修改的内容:
    ; u3 h0 S  A' u: E" [6 T4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    - y8 Q/ e; j) ]4.2 markdown_path:输出的 markdown 路径文件名
    6 }4 y9 J% `' l( K( G4.3 /path/to/pdf/file: 输入的源PDF路径文件名
      ~+ [" y6 O4 c- ~7 U* g
    " I4 a1 y: V  w+ ^$ k# l! A5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 * k' G0 V; P# K. X4 f* [/ X. I/ C- i

    5 y/ }! p9 x- k; H  o% F; c目前为止PDF转纯文字的最佳办法。/ y+ e1 }$ L4 Z2 R4 w
    先写个小程序,把PDF按章节切成小的PDF。
    $ A3 x0 B$ c# \+ C0 {* d. i5 m4 B然后,把PDF一个个传到deepseek,让她抓取,除错,输出。  K- p: @$ w4 H1 K4 e
    效果非常好。
    4 f3 ~0 @5 L; }
    & V& r$ @. j) B) y, t5 edeepseek,qwen,chatgpt 三个,deepseek是最好的。
    , b3 h: d: i2 w' s  B" v+ ~# g+ j1 K) u! C
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。8 n$ ~9 u9 l9 s; N* V
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    $ z; k- |0 q+ ~7 ?* X我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。8 V1 ?, n" {1 F' w
    $ w8 H( c3 M# c
    API到目前为止,差强人意,不如网页版本修得干净。  R7 ~% ~' \2 g8 ]8 \# A' K( n

    / K; l1 a1 S2 U, [' [6 Q  ldeepseek可以同时开四个。! I7 q1 y, v) o1 [, Z

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    & z: G7 {) P$ T* v
      m* L' s. B  u让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    9 j2 U* E* I# n让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    : h) \) t# S; N* o+ ^9 k
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:335 C3 ^' a& X6 l) L% R8 D2 @
    细说一下,听上去很不错,多谢。

    8 R" U) J/ {: _# Q直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    3 T) N3 i, F" ]9 g6 c3 Y8 r6 v0 S$ j, L% M: Q, ^9 w
    已经搞定.. Z& f4 B& d: I$ x9 O
    ; m4 w* O6 @6 L( c  K8 ?
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。! w8 a4 C9 w8 [: X1 F4 Y
    4 O0 m( [9 r* P% k! `2 I
    1, python + pypdf 按章节拆分小的PDF
    3 o* H( F7 W6 w% i6 j$ m) a: t9 W5 ^* b* T
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile6 h5 n/ q* M% h- j& g8 ]
    ) j' G7 P1 \/ s4 [- f9 T3 N7 T
    得到text file7 M- M$ L! T, c8 r  |1 W# U3 x

    ! V* r6 O/ H( H3, python 读取整个outputfile,丢给deepseek 矫正。1 U  c$ l$ r" P) D

    1 e) C! a# B. e+ Q; x; X" ~模型是 deepseek-chat6 v1 A1 V6 f# y( O$ f- x

    " r; j& c3 h. f9 Z1 b$ E& kmax_tokens 最大是 8192,别的不用改。0 ?# M, Q, i* j2 s

    4 @( A7 P+ i( w: u" I3 ~- r参考:6 K( ^5 m: u$ c. r. N
    https://api-docs.deepseek.com/api/create-chat-completion
    0 x7 H" H$ \. o6 V5 ?
    * h, ^0 n: P3 y$ v( ~! c# u- `4,费用:2 ~. k+ h9 I8 q% N
    $ s  |1 a$ D% n: F" s
    实测:
    9 k  i4 s  U$ s
    ; g' p* l+ ?8 @7 q0 r! u296K 字母,用了 9 美分。) M2 F& P" Y0 `$ R
    ; ], T* t- l7 i
    英文字母 到 token 用量大约 1/3' ~; ?8 H$ Y1 b, G! t
    7 h& |. S: k* i( Q4 B$ T
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    6 }  }5 g& X7 l; A0 r4 c& |+ ~) l) g6 v& C% p" U' I# V- ~7 J
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    6 G% O* |  q, B. D/ E( D4 _% z2 u' c3 s3 J9 r! K
    价钱,非常非常便宜了。
    ' E9 C% e1 ?3 C! Q2 n( {3 G+ E6 b! X3 X
    参考如下可以计算,懒得算了。
    5 h- y( p6 ~3 _( b
    5 ?- D% Z- ^1 K( khttps://api-docs.deepseek.com/quick_start/pricing/ a! E" M$ y4 s# }+ s: J
    3 [- Q  Z) D. B
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    & c5 I$ z5 h; D: l0 v* C" r2 f1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    % A0 h7 ?$ W+ A, [1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    $ G+ ]; L( U' v; w8 Y1 G, m- d6 C( `% n" w
    5, Balance
    0 O" A. \% R6 |) a9 I2 |/ A/ d9 r6 s7 B  X$ Z) B. Q
    可以在程序里调用,知道每次运行结束后,balance还剩多少。  Q: b% D9 G( h2 v4 N
    参考:
    * K5 M: i+ j+ ehttps://api-docs.deepseek.com/api/get-user-balance! S* Z! y* S- u7 u) v: K/ z
    ! P' i! L' Q; |
    6, Models
    8 K8 F1 S5 h! m1 j( s7 I% k
    6 E; r0 i+ Z( A$ S- U目前就两个
    $ l/ \# q7 B6 ~* E- g1 g# deepseek-chat6 c% f) f/ c1 A  w5 U( R4 O" ?
    # deepseek-reasoner
    * ?. T  L8 A" i4 {) W+ d, E4 G9 g4 F" a3 V5 m/ V& C
    参考:
    ! t% x8 A9 B3 Zhttps://api-docs.deepseek.com/api/list-models
    . v' Z9 Z0 ^4 V* U! m. J4 L$ K- `3 z, M# E, J( e' x( ?, [

    4 G* Y) s, ?; J% s* z. q. E7, 问题
    : w8 |5 J) H' t# T, V9 q) E+ _# i9 T  S! b7 I
    deepseek 会将前后两段合成一段。
    $ x7 O, c! p" q" ^特别是那种大量的对话的段落,deepseek会给你合成一大段。
    - `- X1 e1 k& [3 M# u
    9 e) d9 g5 B6 y, n0 Q2 c8, 钱说了算。
    ! a5 c7 B  K! |$ O, G6 G& I
    9 H( t5 e1 f( m; kdeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    4 Q" b7 x8 x6 _% ^/ i  h1 T. O' R但是API就不会出现这种情况,毕竟我们给钱了。
    5 G- w" D# S% W( D2 y1 Uchatgpt也是这样的。: c: {3 q" Q' \3 }6 u
    6 j1 d3 |% Y' i2 m( j0 V

    ' Z' g7 B3 H0 k' v. c0 w& X

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-20 06:02 , Processed in 0.087431 second(s), 28 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表