设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3935|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
5 [/ l7 |. D3 L0 H3 W6 `* l4 d3 p9 J3 @" F
把PDF上传,然后让他抓取文字,并修改可能的错误。) a% S. q* k2 ?3 i- u6 E4 j
然后deepseek完美的完成了任务。
; N$ ^/ G# s% t% J段落清楚,列清楚,页眉页脚全部去掉。
7 M! H: ?3 P: d# C4 J我要疯掉了!
" s2 N% M4 n# T4 h+ M赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!  t5 q3 r4 P( H7 M7 \" a
====; p- C2 v4 r% d) f8 w! J
中文也很完美。
& U( E' D4 t* `" D: R+ r经验值,每次十页比较稳定。$ f  i/ U6 J8 t
现在我这里API还不能用,等恢复了,全自动了。; R2 ~) }+ p/ y" j/ ~
====  S' q( n; M5 J( k) A* @
第二次疯掉了!
" m6 d" c/ U' |: G* w我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
! ^  v; _/ P- `7 C====
# `" w7 R% J% A" ]$ l8 C( T现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
  B4 m. L% \% |8 [但是任务多了后,每次翻译的页面数是减少的。
# s8 K( `& Q1 {& W好吧,我五体投地,继续探索。
' a& v. A5 Y) |====
& K5 t$ Y; ~1 A0 X为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。1 y! e! f. s0 d- T! \' _- T
====
+ ^7 J  J  y( J; {. F& m2 j好吧,有些东西是不给翻译的,哈哈。
* |! k0 I# W; N+ q0 I
, x. f: F+ R  ?! K2 R0 DSorry, that's beyond my current scope. Let’s talk about something else.5 G2 d9 S, P  N. x" q- [
====
* u1 [: ^/ f8 e- J6 d4 I然后我的英文命令也让deepseek 帮我修改,呵呵。
+ ^- i+ @7 c5 B4 H' G2 x: a7 ]* H====. V6 @  K  j. F5 A4 k; I
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。: i6 n7 r2 ]- @" @2 }: \/ I+ g
====
% C, P: A( [- F# ^' V时间段的话,北京时间的下午和晚上用比较好。
4 N/ P1 p2 e0 Y. |( v6 Y后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。: O  R) U3 U3 E1 \! n* Y: j
====
$ ~  X3 E/ Q3 V# p! e- x用千问吧,非常稳定,非常强大。
& d2 X" X! v/ d! v9 c- X  B1 thttps://chat.qwenlm.ai/$ I! L3 y9 f! J6 D! p. |
====
9 l. z% A+ {! L9 X3 H" iDeepseek,API 看上去可用了,但是不给充钱。
: S" C) G. E- r7 [
. z+ N* x- |8 |* X1 w
  }& ]7 B4 L# U& K2 E  o
; S6 i- A( p( x. W6 k

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    20 分钟前
  • 签到天数: 3911 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    3 y  c' Y4 C- A$ E这功能很赞呀

    ) W' k+ a. x3 U- E简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13; B7 h! X6 l+ O1 D: G
    有没有上传整本书试试
    1 j3 k( _1 F* J! \9 |
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    20 分钟前
  • 签到天数: 3911 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
      t& q, L8 P9 K2 {1 x9 B5 c7 \$ x, }. T9 t6 h% H
    以后让deepseek 读出土的竹简7 c; y5 ]4 r8 V% m& D1 p) R
    3 x: D% \  I- V# L0 Z( m3 t$ z- I
    还有把古文翻译成现代白话
    0 G! L" [9 n7 G3 `
    , T4 \2 H2 K5 G9 I0 M  \. b' _以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    昨天 18:59
  • 签到天数: 3067 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    ( n: a' ~; ~8 U& o/ l7 p$ I: w
    % r. k' Y  r; J8 @- \我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    , S9 W; a/ e+ E; @# _8 s请教是如何实现的?
    $ I& B( }( z. F* h! K) |2 p/ `# X$ J& I/ X$ ]" N# C, h5 h3 x
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    7 X4 K8 T, n& g  G  ~
    / O/ s: e: u4 F  ^我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。2 E, l# o, R) l
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    / z' i) h6 @1 q: S美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    8 N- F5 o$ R: q: m% G" ]

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    4 X% T4 k0 q  W5 E0 w" j请教是如何实现的?: A( g3 Z6 ]8 ?# B6 I, A
    1 l& m# e: l! e( c
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    . s! \  F9 G9 f' ^; f7 jhttps://chat.qwenlm.ai// N3 Q4 L2 p  V! v% M
    试一下千问,估计美国人没有攻击他,所以资源敞开用。) x' j8 k0 k# D0 F) t9 n) r
    很稳定,质量不错,好像最多一次处理15页。0 h  C8 q+ z+ S2 q7 F( M( S
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    昨天 00:00
  • 签到天数: 3173 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。; c. Q3 n/ X" O* D5 d! z/ I
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
      z4 Z# G/ j& }8 h这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。$ `; g' O, n* M( F
    ) V+ E0 R2 {- t. W
    https://github.com/oomol-lab/pdf-craft5 b. U, Q  c* {. j% o' r1 S) B

    - J4 d5 M: r: j, z; |. N8 V1 U1. 这个工具要求装 python3.10' t. ^- H8 g+ B
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0) G9 [* |* T* c& {& H3 i( s
    3. pip install pdf-craft
    5 r/ r# h2 }" w6 Y4. 把下面的内容写到一个文件里,例如 a.py
    ' C4 l2 B2 ?# r$ m+ w$ q3 G, ]0 S; q5 A; _* w
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      : p2 x: V% c* o

    2. 9 `, P( [$ b& e4 a8 d+ g( ~
    3. extractor = PDFPageExtractor(/ r( \# K1 F1 {, l' C) w
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.- d3 j) _4 C5 t
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed5 ~- k# p  S* X8 D
    6. )5 S6 T8 c: r$ |
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      9 n. S+ E2 M1 _& k0 K& Q
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):6 }  I" U: w2 q' P* H  x
    9.     md.write(block)
    复制代码

    5 G$ _5 \" Q3 x8 o$ }" u$ _( y, d$ O8 ~% K' T3 k
    要修改的内容:
    ! a% t) I% P1 w; Y7 [4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型' c. C% k; \2 Z6 q2 U5 n
    4.2 markdown_path:输出的 markdown 路径文件名
    # Z# P7 k" [/ I* e4 E; v4.3 /path/to/pdf/file: 输入的源PDF路径文件名8 K$ s, e2 s% D" B9 x; a
    8 M. Y1 O" Q; K) q
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 . l  g( `7 _6 W; f

    1 e  c0 w0 U# S2 p  g目前为止PDF转纯文字的最佳办法。0 k; A/ ]. l" R# x6 d. m" G. r
    先写个小程序,把PDF按章节切成小的PDF。
    $ \& ^& }$ o& w, [. G5 j1 w然后,把PDF一个个传到deepseek,让她抓取,除错,输出。# E( m2 V( Z; u6 F9 Q1 W4 l0 Z
    效果非常好。
    8 i, h5 {  {& D) P* C9 h; s' e; M6 o0 q. h7 F
    deepseek,qwen,chatgpt 三个,deepseek是最好的。
    & N6 X: O& o3 G; }1 w' \- {, [! F5 p! F
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。+ @! Y9 M6 a) i' O
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。8 ~% N( U6 k9 f1 }7 Z
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。; U7 u% I' Q  r" {& @

    6 l& V1 ?: r+ F) @0 L; c1 h' U# l" X4 xAPI到目前为止,差强人意,不如网页版本修得干净。' H  ?  k) w8 W. I: z
    ! ~: |/ C, u1 Y2 g( J, y
    deepseek可以同时开四个。: a0 |/ G% X# l, j0 k

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    0 U0 W5 Z- U/ {% j' t5 Y6 l3 M. f. f: h
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    . G- t3 f: d6 E& `) w让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    - @! F; ?; s$ X3 r- \  Y细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33  ?8 S. U: q6 c
    细说一下,听上去很不错,多谢。

    ; v% R! o% S& j' r- J直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    : Y) g( I, o8 F* ]0 H% V
    2 @: W; `. V# s5 n* N2 w* q已经搞定.
    , g+ T6 T/ x% |$ t$ U. _: |8 _" D# \: n0 m
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。" a, D/ m2 Z8 H* ], k7 T) k
    5 e3 J) y8 N, a( Z- E* d
    1, python + pypdf 按章节拆分小的PDF
    2 }, {1 z$ w9 f* I! @+ O
    , M6 g& q- |* V5 |4 B2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    & y( q4 }$ o. e) q  c; z
    ' P5 [1 K% S$ e9 _" Z得到text file5 k  [) h. X! w6 N

    2 h' g) d3 Z) ?) z* b+ f1 L3, python 读取整个outputfile,丢给deepseek 矫正。; E6 p7 k  j) J7 a
    7 J) P# h& {. T9 n2 q6 @
    模型是 deepseek-chat
    - z! C2 D( D9 }" C4 w5 n. {, H% Q9 a8 q1 o
    max_tokens 最大是 8192,别的不用改。
    , a2 Q3 u8 p, m. S( G* L* S- I& U
    参考:4 h" m! E5 m9 d8 ~4 i( Z/ I
    https://api-docs.deepseek.com/api/create-chat-completion
    ( r$ [: s( @& x( J$ t8 {% T4 @8 M: \  O9 u) M9 z
    4,费用:
    5 z. G( b% f* V. D; \1 R$ J! Y. T% G
    实测:
    ' \/ J/ F$ Z* _
    + u- t% U  i5 p: V- ]) u296K 字母,用了 9 美分。
      R8 v: d' O' E% B. A
    7 E/ u, i; O% o* q" Y' [1 N英文字母 到 token 用量大约 1/3
    - K' T& K- x# }) H7 w* r! C
    2 I# e/ @4 T  X& I& ]  ztokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    " m3 U& k( W9 {. [+ Q. L% @7 [; h) I  d( @  `! }! O4 A
    32899 个字母花费 11782 tokens,包含输入输出的 tokens# }# X0 V! A$ p0 u9 d( ^0 S

    - I( ?" w# _: y! P, _. Q价钱,非常非常便宜了。9 \9 q  a& _4 L) X. B, T
    - |) L) B# G: ^# j
    参考如下可以计算,懒得算了。3 c7 r! F+ M; I' \2 L' c* i
    3 p3 f4 T" L# m- x9 P! s; @& T
    https://api-docs.deepseek.com/quick_start/pricing9 {6 c7 t9 }# [3 F. A. u

    $ l1 D: l2 K2 w6 ?1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    , x7 b( q/ w/ A5 h  {; ^1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55) k9 F. ]+ \0 J# j
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19& E4 R: n0 H$ f3 _: f4 s4 S  m' u
    6 b" j3 M4 ~7 C" Y
    5, Balance5 W. C4 K, e" d8 X8 u" H6 O. A

    / R7 ]/ F; ~* o2 N+ ~/ k2 t: L可以在程序里调用,知道每次运行结束后,balance还剩多少。  f& _/ k( n' W6 D
    参考:% y  [5 u8 d! X4 ]0 `& X- r
    https://api-docs.deepseek.com/api/get-user-balance
    $ ^+ A' A3 C' a) l$ M% `, C0 K- ^4 t- \& N
    6, Models
    1 j2 j! d8 z. a$ l+ I
    ) K  q9 l* r4 ?& K目前就两个
    : b4 }4 m' ]3 B# deepseek-chat
    - G/ G$ n" a, }' E+ |# deepseek-reasoner2 y- N* Y% H" a* ]' G3 |4 d  b
    2 s! Z2 y% k% T0 p8 V4 c( D" [
    参考:
    7 T5 z! P; b' U7 P/ m2 _! r) i+ yhttps://api-docs.deepseek.com/api/list-models
    $ x/ x  `: E: O0 n$ W" m/ t: Z7 w
    % a, a+ ~( m8 q
    ; K1 j0 ~/ i/ ~4 F) q( K7, 问题
    1 `9 ^- }. U0 r2 g3 ~6 B9 ?' w# K0 Y' e8 l
    deepseek 会将前后两段合成一段。
    2 x9 P1 n& D" t: |" q; j/ z特别是那种大量的对话的段落,deepseek会给你合成一大段。" C4 @! f* d, J
    2 N9 I9 F. i! ^# a+ C3 b8 o: N
    8, 钱说了算。
    & A# F$ R; @/ _( g5 A) X; {$ _
    ; i2 u8 _4 e1 M* `deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    * }) A* P! C; v9 R2 J9 l3 u: ^. p6 y, q但是API就不会出现这种情况,毕竟我们给钱了。
    3 r% I; ^# P7 J5 p/ T% I. Jchatgpt也是这样的。  l# f, V6 T3 I, _/ Q) ]- I. r

    - |' B( |1 W5 \9 Y7 K8 z* I/ S- R( Y* E, @- U

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-20 01:03 , Processed in 0.064902 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表