设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3780|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
8 g7 K6 w# m) w/ N5 P! ?* L) h9 ^7 y/ o
把PDF上传,然后让他抓取文字,并修改可能的错误。
. D6 Y# B& ]* f2 x& Z7 H然后deepseek完美的完成了任务。
/ j/ ~  ~) }  R! e段落清楚,列清楚,页眉页脚全部去掉。
* b- I6 d8 U. X; L) U5 Y8 L/ I我要疯掉了!6 z3 t' l* [9 a1 {8 y' k$ {
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
4 H! S# Y; p; L# [====4 X4 ?" M4 J; H2 q/ u0 {$ J# p
中文也很完美。' d# p4 o2 K. a/ `2 \1 K6 ]
经验值,每次十页比较稳定。
/ T7 B9 N& F, a  Q  p# U2 _5 ?现在我这里API还不能用,等恢复了,全自动了。
- U* c2 r1 S" g& K$ ^* y7 x====9 D" y- ]7 p3 ~- z
第二次疯掉了!
* Y, N9 m/ b) J+ x* Z3 o) {我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。& T7 L, H0 c" O+ Q
====4 G4 j0 L6 G6 {! F; y  {9 t8 o
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。3 @5 S: W- z0 H6 a& {; p# E# |
但是任务多了后,每次翻译的页面数是减少的。
/ a. T5 {2 n! r2 o8 r好吧,我五体投地,继续探索。
" O6 c  r6 X9 p. V% n1 {8 k9 O4 N====1 D# K& g8 ]* y. E/ |* o$ C4 s
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。* P# g8 Z  y+ m6 c
====! q; A6 w: H# H! d$ @) u9 N2 S
好吧,有些东西是不给翻译的,哈哈。
! |9 b& S) Y1 L) a1 P- l6 l0 N% Q. }9 E* W, }4 J5 H. Z# g
Sorry, that's beyond my current scope. Let’s talk about something else.: v3 H! e! f) e0 S6 }
====! q5 n7 l$ r; v) d1 F& F& q) i
然后我的英文命令也让deepseek 帮我修改,呵呵。3 ]: i; q. K3 q6 C5 \* d4 a, q
====2 _' k# X) M  ^( S* |
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
% x  ]6 k, V0 k) ^2 E====
& M2 E, G1 s* K8 Y6 t1 Z时间段的话,北京时间的下午和晚上用比较好。
% @% k' d. t9 Y8 R' W3 s# F后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
' k8 C, ~1 a, o5 a6 |====- I7 ^4 d0 Z, C" N
用千问吧,非常稳定,非常强大。0 k5 p$ `+ y4 ^
https://chat.qwenlm.ai/
% q6 {6 m! B5 k* u2 K. w. V====5 I* n  t( J; H* [/ x! g
Deepseek,API 看上去可用了,但是不给充钱。2 s2 [0 u$ l# I* C  u+ x
7 L' P. J/ D4 W
# Y8 y' p5 h' w0 Z/ _' B* h8 j
: C& T2 R+ X! M" M) k- s

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    6 小时前
  • 签到天数: 3896 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    # O) P5 W! h8 x5 s  v$ m' o  M这功能很赞呀

    5 A3 l2 x. M3 ^$ g简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13% v$ i7 r, `- ^- q% l' U$ J
    有没有上传整本书试试
    ) a1 q5 G, p, ~" b! b% z
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    6 小时前
  • 签到天数: 3896 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    " y" g. L3 F, _9 ^2 |
    8 q) i5 x0 u4 u: f2 f以后让deepseek 读出土的竹简) |/ R: K/ Z4 [' q, n  q. `1 t
      L6 i7 k" g6 v% y# i
    还有把古文翻译成现代白话
    5 ?; Z6 `: ], V( {, e9 h, k
    * }4 q0 Q4 J' G& G5 m# J! f以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    4 小时前
  • 签到天数: 3057 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    7 s. u7 x0 e& k, A$ \4 b5 l4 L7 N3 i5 \: [
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    0 y7 L4 W! u5 A1 o  V请教是如何实现的?
    4 }) E( K! i0 o, h% d
    / \& ?, a( X7 b, L我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    % i% e+ E, x* \7 L9 G5 E# j: e. u$ X
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    ; ?# [6 E- W% y0 q& j文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    & d4 f& Q9 r# J% i美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    1 b/ }2 f, V3 N' J: P4 f

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:231 v9 S, ?. W8 S& [' ~' U
    请教是如何实现的?) Z7 Z8 G& x4 k3 v

    % L, d) [$ `% k- \. P4 [我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
      q/ x2 J: F% [7 m/ i
    https://chat.qwenlm.ai/3 g2 X7 n9 s8 a2 Y( z" C7 Y
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    8 t6 v$ v$ d' O1 e( C, d) F很稳定,质量不错,好像最多一次处理15页。
    8 a2 y2 w' p* o* u我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    6 小时前
  • 签到天数: 3159 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。" K- u8 s8 N+ z7 j1 l" G5 P
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。( v4 {. Z  _$ q. z) o
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。7 U7 T8 {  k3 b/ H; |
    6 A! |7 F2 L4 @! \2 J
    https://github.com/oomol-lab/pdf-craft
    9 r4 _( x, s/ U* [( k! V% |" H2 O9 t2 U. w8 z3 I: q6 K
    1. 这个工具要求装 python3.107 l  T6 B" K) Q) {
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0) h* {' T$ |9 g) `# @$ q* H3 |3 ^
    3. pip install pdf-craft. {8 v* N6 I4 j5 J/ Q. \9 T
    4. 把下面的内容写到一个文件里,例如 a.py; K2 M0 X+ X1 Q! q& u

      a5 M9 v5 f. T' k% V& x
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      , x2 Z1 P% C5 K: S. W, `
    2. : ~2 f" Z4 e1 r
    3. extractor = PDFPageExtractor(7 F4 T2 g1 X0 f5 V; L1 N9 c0 x
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      2 ~9 G4 c/ y1 e2 T0 M
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      ' P( J/ n: b3 Y$ ~1 a
    6. )
      ; h/ g9 A3 T/ X$ t% ]
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:  q; y; o. ?/ s2 |" E$ m* u: f% N* H
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      6 C; r4 B  N/ e& T; J/ \/ P
    9.     md.write(block)
    复制代码

    9 `9 v4 f* w" m$ {- b: y. e5 P- Q# ^
    要修改的内容:
    9 m; e- Y7 ^3 Q; Y5 H# e3 u4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    - I1 B! ^( _6 K2 h. D/ o1 E4.2 markdown_path:输出的 markdown 路径文件名
    4 z6 i6 n, y6 A4 L! h, s' Z" r6 @4.3 /path/to/pdf/file: 输入的源PDF路径文件名4 o# ?# {- R8 _9 \% c
    4 t+ k! l+ [2 S& ?
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 ' r; ~/ {: c. N
    7 B6 B: R7 O+ f, k9 D7 y
    目前为止PDF转纯文字的最佳办法。
    ' B( @: q" l& X% b先写个小程序,把PDF按章节切成小的PDF。
    & _7 U5 O+ J2 \8 g: d# y4 O- w然后,把PDF一个个传到deepseek,让她抓取,除错,输出。9 d" M" H  V# f9 }$ W- ~
    效果非常好。/ ?3 ~3 k2 |( f: Q
    ! d; n2 U" P' g" \. @
    deepseek,qwen,chatgpt 三个,deepseek是最好的。8 H7 z. E" b9 y+ o

    , p. k9 Y! W* \deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    . \1 x# O- R) H3 H. j$ c3 }( [  Y而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。) B  P: p6 D! f, v; [- v
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。& n/ p& Z# p5 Y- q) j. a
    + W! u. R, Q5 h, a5 H
    API到目前为止,差强人意,不如网页版本修得干净。+ S* w. s5 `$ n0 I

    6 @. Q4 ~5 X/ U, O& t+ {deepseek可以同时开四个。
    ; ?; \" G3 T; {) p

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    $ {" M% @: v1 \/ O  ~6 F, u7 |4 G3 U" C
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    + \1 A! T" G. D5 b3 M1 [让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    + G5 n7 _( A# V
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    3 d/ q% R; [) o. o细说一下,听上去很不错,多谢。
    " ?- R8 d& T4 l3 ~. v
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    & {  k  o, ]5 H: S# f9 ~! [& S
    & K0 J+ A$ C: u, f0 ^- @已经搞定.
    ) R% O( o9 B: m! _8 U( }, h0 n/ s% G* H% z
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。0 ~& |% ]! W2 h
    7 A# ^% X  A% T3 l& L! \8 H6 y: M
    1, python + pypdf 按章节拆分小的PDF
    5 e& I# ^% A; k1 F# W
    0 U, o( m; s7 R9 Q3 O2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile. D1 D2 m+ w: A: p0 v+ \* ^. L
    6 B* j- ^2 v4 I6 u& X6 f! |9 W
    得到text file  U9 q/ K5 }$ ?3 `- C
    : d, A! X1 ]* G( S4 \
    3, python 读取整个outputfile,丢给deepseek 矫正。& S% R1 v+ j0 n  c# v: e- j% N% A) b. v
    9 ?& e4 X' R" I( K3 Q
    模型是 deepseek-chat+ S$ @3 I% |# }7 M' \
    . z) R8 ]/ K, _4 s7 D  Z
    max_tokens 最大是 8192,别的不用改。
    - N% J6 l& I6 e" ]5 W8 W& {* _  V  j0 ^/ x0 b7 R8 c7 Q$ y
    参考:* q7 `9 P) F" x, K
    https://api-docs.deepseek.com/api/create-chat-completion
    7 @+ r$ z7 a6 m. E: h' Y7 l& Q* X/ o* E4 S1 b' G- [2 E
    4,费用:6 ^% v/ A' e# l( ?. C  K; I

    : |& o* l) _* r9 o实测:, ~3 u  h" A2 E- b$ d2 s

    1 }6 _+ y! w6 B& k296K 字母,用了 9 美分。
    6 W% ~4 l$ ^! @' R
    3 N7 K- e, _/ V6 }8 m. R  o* L& S英文字母 到 token 用量大约 1/3" n. e  E) J( z0 f

    ) T4 s4 z8 Y. Z9 I% ptokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    ; ~" V3 F( y# d5 s. ^) g* U/ T6 Y3 e/ ]0 Z
    32899 个字母花费 11782 tokens,包含输入输出的 tokens! t/ U- u; F. Y' l

    # n; {) `, S0 a. l/ k+ j价钱,非常非常便宜了。
    $ U% {& l& ?% F. ]$ F2 t2 T) `% M$ A
    参考如下可以计算,懒得算了。
    5 I6 ?; U: ?- p5 R7 @: Q0 [& C1 m; Z$ S' T$ y
    https://api-docs.deepseek.com/quick_start/pricing  x+ |4 D/ Y- l) J  ~3 g% W) {" ~
    ' p. l8 M) S' m
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.146 k: G! {- N+ O  @8 m# k1 s$ N
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.554 O+ y4 c4 X/ y' ?: d; I! Q
    1M TOKENS OUTPUT(5)                                              $1.10                $2.196 u4 e- A  N/ }

    9 `9 [) a9 s! Y/ P( p: y% j7 d5, Balance
    0 q6 x1 M- `" g% [) K2 z" O2 q$ Q: P: R  b+ i) A. E
    可以在程序里调用,知道每次运行结束后,balance还剩多少。
    / s( x, W8 s& X参考:
    % b! N# U- M' L1 ^# Q% ohttps://api-docs.deepseek.com/api/get-user-balance4 z  l) c/ y7 {9 l0 u- r" F, f

    3 `6 _2 L1 R8 o' q/ |. k0 `% _! z6, Models
    , P9 a8 c' o: }7 g" q/ {
    7 c* z  N9 r/ _$ `" ]$ T/ W6 W目前就两个
    8 Q* X7 l+ \& f" h" ?# deepseek-chat
    9 L# g% }. T" ^  ^4 V$ d# deepseek-reasoner
    & |3 g9 X* i2 F& U) B7 J0 c" T' I; e) p! w
    参考:- }. d) `$ J9 b; _+ Y, i
    https://api-docs.deepseek.com/api/list-models6 b: W/ P/ \* O9 J
    9 P: W6 R; }: u9 t) b
    * G6 s- z  P5 `
    7, 问题
    $ T2 i$ d" d9 x! X6 ]9 d' s0 w; G" w1 W9 Z$ L6 y6 ?1 @4 F" |. _( T
    deepseek 会将前后两段合成一段。  ]" Z$ h& o" y$ ?5 [4 o
    特别是那种大量的对话的段落,deepseek会给你合成一大段。/ L. N0 @9 D& F

    : D  P7 n# E2 p7 g8, 钱说了算。' |3 E: r3 s7 @; ^; w) I

    4 H1 v& ^7 t' y: ~deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    8 l- L2 O6 ?& o8 N8 [; G, Q% J. M但是API就不会出现这种情况,毕竟我们给钱了。! v! m0 }6 J# K0 g+ f
    chatgpt也是这样的。% N& p& R' C. b  S, B  G- [* s8 d
    & [; }6 W+ \# a0 V: r1 o

    " z8 F! d# K) S) [7 b" ]: T

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-5 07:36 , Processed in 0.063682 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表