设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3437|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 3 b! ]( [) t  Q$ d3 T+ q; r, v  z

, T6 l, O+ g+ v; j把PDF上传,然后让他抓取文字,并修改可能的错误。+ J9 p* ~) @0 h6 ~) K" h3 c
然后deepseek完美的完成了任务。: s5 T/ O5 J, z( {7 N. N
段落清楚,列清楚,页眉页脚全部去掉。
% {- _# r( z- Q/ F( t2 S# h我要疯掉了!) N' v  B  v, r8 d. k- M# G
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!7 X/ I- a" N) Y, _' H+ A! p
====6 q8 j5 F- L; f% M
中文也很完美。
% o& f* k+ C0 e; [" l& t经验值,每次十页比较稳定。
4 L- w: T3 Z1 l' i/ D现在我这里API还不能用,等恢复了,全自动了。
& ]: A: o, x8 G: {& O====! g( ?4 w, @2 P7 E  a
第二次疯掉了!/ E3 a0 Z: r8 j* B( e/ j1 L
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。& D8 |/ q4 ~5 d0 x
====
7 z" v2 E, e# X6 E" M. Z0 S. {) H现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
$ [3 z# k2 N$ L但是任务多了后,每次翻译的页面数是减少的。
) j1 Z1 F4 `9 Q5 D, J8 j7 ^" p/ ?好吧,我五体投地,继续探索。
  F5 P( _! A$ j- j- V; q. ?====: v+ [/ e( u$ N+ Y/ I, a
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。% d) a! x& J& m$ N- I, G5 P
====- H' G5 w8 y# d, F/ i' b! @
好吧,有些东西是不给翻译的,哈哈。
0 X1 s, _# x& F  p
- m% D/ W2 k( U' _( r! Q; M& ~Sorry, that's beyond my current scope. Let’s talk about something else., ?6 s* d) d; c# M
====
0 b' i/ E! W$ \! s. i然后我的英文命令也让deepseek 帮我修改,呵呵。
! V: B7 O0 Y, J+ A$ |. R9 c( [====
& Z6 E. m" z+ R日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。8 u+ u& q, w4 `& S8 Z8 y
====2 {7 T" j; `8 `( ~/ F$ k+ d! }
时间段的话,北京时间的下午和晚上用比较好。
+ {6 t: q' d( k' A0 o' X后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。( B' L6 W2 I( ~/ h
====
- C: r: m& {$ a9 w用千问吧,非常稳定,非常强大。4 d/ Z  q, n$ v6 B. \. c% z% \; \- J
https://chat.qwenlm.ai/8 x% R+ ]- g, B8 P! f! R* M' t+ p9 [
====  m; K: z, I- T
Deepseek,API 看上去可用了,但是不给充钱。
; [7 ?- o8 v3 L8 \3 d( g$ s0 f) j3 t7 T% y) G0 E

' `/ n( t% ?( [; E, C/ o8 h- @0 u) t1 P7 Z3 \7 ~% j

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    20 小时前
  • 签到天数: 3868 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    6 z# a/ e* J+ M7 R这功能很赞呀

    % W3 H8 a( c3 T1 C简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13
    0 v; ]/ h/ F/ M( L1 i8 H有没有上传整本书试试
    " s% |- E2 x3 H
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    20 小时前
  • 签到天数: 3868 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    2 g' O' p4 r; a% P( H# ?
    7 L9 C+ \7 Y; P* L. M2 H5 f以后让deepseek 读出土的竹简* g% w# L8 d6 P  h
    - z1 N. c$ B' E) R6 W& o
    还有把古文翻译成现代白话
    6 U( Z, w& {9 Q/ a8 j% T$ G& g: k" t9 d3 Y7 L8 {6 U
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    20 小时前
  • 签到天数: 3029 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    $ u, p4 |1 R$ C5 k4 m! l/ L& p3 ?/ Y6 q6 l
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    5 p, ?5 c5 Q/ D. ~8 U$ `' ?( q' o( |! Y请教是如何实现的?
    " B  _% T/ e: l- N9 X) }
    2 W) x! h) j& _% }我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    ! V: w: @5 x1 [% Y8 ]3 ^2 e- y7 G% i6 u) a' ]: B
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。: e+ v, @" V5 h. g' a/ U4 c
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    $ e6 @1 Z$ C: A) T& ~% l/ @美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    4 C0 r3 D7 K0 Z

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:237 W/ l1 F1 [1 U6 D+ n5 n
    请教是如何实现的?0 |9 ?3 s/ l  `5 w

    ' ]( [3 _8 q& D' b5 \我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    9 L' I8 o7 m' s: H+ ]4 bhttps://chat.qwenlm.ai/1 N2 I0 Z" u% A- A( D
    试一下千问,估计美国人没有攻击他,所以资源敞开用。& Z1 m% n; j4 t: w7 G/ b6 y
    很稳定,质量不错,好像最多一次处理15页。$ k3 y1 m$ ?" k! ~% L! J
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    20 小时前
  • 签到天数: 3133 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    9 M) P( `7 p0 q/ k" {. T处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。( f) c# ^  V5 z9 V! U4 ~
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。# ^! l! |& |- ^
    . N# l" O1 W, Y7 i8 s' v% i! z+ ^
    https://github.com/oomol-lab/pdf-craft; o/ U1 Q$ u4 O; m+ s- Z3 D. {
    " N2 n6 V( y9 Q8 v
    1. 这个工具要求装 python3.106 w0 e- q8 H  j3 t
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    . _) y1 }) `4 L  q0 Z3. pip install pdf-craft  p4 }2 V4 @& q, c" w3 E
    4. 把下面的内容写到一个文件里,例如 a.py, O& c4 W9 {9 o" P% g, e6 C% g
    # N7 |  B8 L8 a0 p# T
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter7 l1 a: l* T" v  `
    2. & u! f9 o, m' @) V! E* n
    3. extractor = PDFPageExtractor(
      7 w- p; J8 M1 ~1 m" G* p+ z* R  D
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.5 H# _$ D/ {- |: ^) ]5 U
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed" w, V" q+ ]& J; ~: n
    6. ); ?8 b, ^/ b) j3 V& Y2 ]
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:* d2 o2 x9 k& ^, d2 l; [
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      . a4 _3 q% O; o1 E5 ^
    9.     md.write(block)
    复制代码

    9 K/ ]( W  |; |4 w2 Q8 }) u. y7 J2 d) m  X) m! h
    要修改的内容:( G# N( u% N* r. a& c. B( j( H0 ]6 O
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型" {: {$ W! W% T& v: i
    4.2 markdown_path:输出的 markdown 路径文件名1 f4 ?5 U5 B$ W! ~5 y4 g1 Z
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名
      X, L0 L# b$ ^' W) H( o! a0 e. j- d' b4 j
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 8 H/ t- \. d$ X- U2 [
    : k8 {4 ]1 i+ S8 V5 N9 G1 d: ^
    目前为止PDF转纯文字的最佳办法。
    # O7 Z. w; S) h7 {* @8 C3 S先写个小程序,把PDF按章节切成小的PDF。
    ' Y$ x2 I5 p3 ?' Z) V( P" M( Z然后,把PDF一个个传到deepseek,让她抓取,除错,输出。# J" u5 o9 N- ^+ ?+ D6 C  Y
    效果非常好。5 Q; e/ h4 w6 r) }

    : e9 z2 w" t0 m8 F) y; D( w0 rdeepseek,qwen,chatgpt 三个,deepseek是最好的。" x. p9 s7 x2 g. U) l
    - T) j2 x: z9 X# h; X! C5 }
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    % e5 v+ q& [0 a7 I而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    3 ]. r6 j& I3 T+ y1 w我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。/ }( t7 _& h5 d! {
    : D  r' m3 J! _
    API到目前为止,差强人意,不如网页版本修得干净。1 ^2 s6 J+ b# q4 Q0 T

    6 p* w! ?$ t0 \deepseek可以同时开四个。8 ^0 y- o2 H/ t" z0 T( h/ f

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    ) C  X4 x6 p! g' J8 C! ]( y! E
    + h6 Q+ V( t" D8 c" q2 a让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    ' q8 t0 M. P; R+ }+ O让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
      V3 @) `1 ?# z- R
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    # m% K8 R' K! ^# S4 W细说一下,听上去很不错,多谢。
    5 n  ~% j. Z0 J% ~7 G' H8 P+ K3 M
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    7 P) C9 r1 k" r5 I0 E# X  l% I$ Z3 X! }2 E# p% m# G. t9 \
    已经搞定.6 ~% Z$ i) }+ t9 y6 ?+ x3 }

    7 |' q- F  v- N, [: O2 s首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。2 ~2 t4 |* K4 K& g/ t1 }

    2 K( T( t& V: J  ^' N- b1 C1, python + pypdf 按章节拆分小的PDF) `8 H5 L' U  m- O0 F# ?3 Y
    4 {' |7 k5 I) J" P( b- b
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile+ [/ r( H. c7 b& T
    : c2 K; b4 y% Z$ x4 E
    得到text file6 `# d7 u( s% G% C  i: ^
    : ^$ e  v$ R0 B% E, {" P
    3, python 读取整个outputfile,丢给deepseek 矫正。
    - I1 m* H; R: o8 ]
    # q$ `& r, Z% \2 [- g" t  h# b模型是 deepseek-chat
    4 C7 u8 {3 U$ l$ S
    % A/ ^. H  ?5 Jmax_tokens 最大是 8192,别的不用改。$ U3 o& t" S* Q' u0 B% M6 h. [

    - W4 J7 e# f/ H: d, K7 u2 Y- J+ t* K参考:/ A# y6 V+ `1 o5 {9 ?5 j
    https://api-docs.deepseek.com/api/create-chat-completion
    + V5 f' S) v3 s$ [' ?. o( S5 X$ f0 O- ~+ M6 D5 @& Q: v
    4,费用:' A9 D/ W& a+ [$ k; s" s3 E2 A8 u
      t# K4 o% h5 v2 D4 I, ^
    实测:
    8 J9 d! d; v" g4 F2 A+ a( _$ L. W! ^1 ]% P- G2 [1 h
    296K 字母,用了 9 美分。* W' F8 t- O) h% w+ Q6 u9 u& l
    ( _8 \5 b4 O' k
    英文字母 到 token 用量大约 1/32 @) D5 v: B# X' D: A5 Z8 Z% @6 u( o
    : i" y9 s! m5 o3 g
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    , ^5 U! i6 [, a0 w" k4 o
    , @( m- w. B" |0 G- c32899 个字母花费 11782 tokens,包含输入输出的 tokens
    % F* E) c. ]& f+ L1 n$ k: U3 g5 l7 Z/ j( F8 a) f/ H
    价钱,非常非常便宜了。) ]5 N3 a: T6 D$ E8 H! l

    * j# i1 O7 H7 K7 O参考如下可以计算,懒得算了。. {1 \, d# P$ W/ J
    * S- R8 Q* v, s3 {5 R6 g
    https://api-docs.deepseek.com/quick_start/pricing! c& v( K) ]; R7 \5 d: C: M
    2 H& a% E: a( x: Z, B. d
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    ; ~) W5 b$ A7 A3 g: U/ ?- ]1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.554 _+ f6 k7 p' _: G5 `8 a) p
    1M TOKENS OUTPUT(5)                                              $1.10                $2.198 G% \7 e+ ?* @1 Q
    9 I% M1 `( F. F
    5, Balance3 c' }6 ?6 Z  Z4 }" m! L1 `$ p" Z

    ) x2 z# s1 o6 X0 ?/ p; Q6 i1 k可以在程序里调用,知道每次运行结束后,balance还剩多少。5 N' l3 A  i- S" a& i% ?
    参考:$ o+ P1 Z) U" R* G
    https://api-docs.deepseek.com/api/get-user-balance
    3 Z$ E0 O  q. t# b# x0 w+ c  I- m# Y! u, \' O, |, s
    6, Models6 s. H- i" y- M) e! p$ c7 ?2 C/ |5 i; X
      d. H* z, F5 ^! x# R1 h1 `
    目前就两个
    9 U' T9 E( V/ _3 j  ~; X( ~$ @9 I  n# deepseek-chat
    - t& S( ^4 Q, J$ p+ Y2 K# deepseek-reasoner! s$ G% G  A  e8 `
    9 k- v# e  B$ q) Z2 @" A- C# P
    参考:
    $ C- A0 r& g7 [% F. xhttps://api-docs.deepseek.com/api/list-models! p3 P# r* u) T7 L
    ' t0 M: z0 r( q6 T7 Y% @, Y
    5 k0 T  D+ `) h4 M
    7, 问题# I8 k- {4 v; H, c: t- e6 |. a' h
    5 A2 H; d4 p6 _" D6 V8 \7 {3 T
    deepseek 会将前后两段合成一段。
    ) B; E1 Z( _, m0 D4 S特别是那种大量的对话的段落,deepseek会给你合成一大段。! j9 |* k' t: t# u! f7 z
    ! c" L1 s. e% v$ P2 X+ Y3 i# Q* N
    8, 钱说了算。! b8 U6 G, @2 N

    ; ]" N4 v& x# m% `5 ndeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    ( s. {# C" t2 F9 M但是API就不会出现这种情况,毕竟我们给钱了。1 {3 @/ u+ u( n
    chatgpt也是这样的。* e$ B$ `6 f$ k
    ' d" [. a2 P" i! L' R8 z  W
    # _! w" g' p/ r' R7 A# a/ c  M0 J, r

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-8-7 20:46 , Processed in 0.063651 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表