设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3952|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 0 M& @: W0 h  i2 J
1 D! g  d# u* ]5 |+ E) r
把PDF上传,然后让他抓取文字,并修改可能的错误。$ D* n: y- n' K0 a) I0 Z
然后deepseek完美的完成了任务。
* Y7 _. D# T% p& S1 N  E段落清楚,列清楚,页眉页脚全部去掉。, v* d0 e( G! \! _
我要疯掉了!8 h# k; U, O" \# O% B( U+ @0 _2 ^
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
/ J/ m: k# |! J( x! `, `5 `$ ]====) K- Y' W% J: K0 T7 A
中文也很完美。
& {* V* }5 }1 A3 a* P! o0 S8 o经验值,每次十页比较稳定。
. O1 l1 d# Y/ m# i2 m+ Z现在我这里API还不能用,等恢复了,全自动了。! i% ?. v7 Y2 Z: m, _- r9 ^
====0 I8 t: |0 ]  z
第二次疯掉了!& o4 s) c( z1 T+ K* j5 |1 i( f( q
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。& i( S: Q; A9 k: P% R* O
====
  C, [  v' N8 S2 b: h4 K: t现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
7 ]6 C4 R2 P# S9 G) O但是任务多了后,每次翻译的页面数是减少的。
0 h4 e' r! J7 J# B8 j5 b- p好吧,我五体投地,继续探索。
+ ]! g% d, b1 S====1 H  N/ B  J% _
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。8 d$ c: F0 f6 W6 R
====4 N" k# ^$ c0 R* V  N
好吧,有些东西是不给翻译的,哈哈。: A, I9 i8 j2 U# p
$ u  M+ q  p( M+ H# Z' D9 b( N0 P
Sorry, that's beyond my current scope. Let’s talk about something else.
! P& o8 Y+ \$ {; g* ^: n9 r====
/ i# v- p: u5 i4 {然后我的英文命令也让deepseek 帮我修改,呵呵。
6 S" z2 J2 h3 t" n====) Q% r/ G- E5 r0 W
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。& t2 z$ ~+ ^- J( y/ l$ i+ |
====
# f4 ]8 V  R4 k& H时间段的话,北京时间的下午和晚上用比较好。
1 s8 L% j4 O7 ?# b2 j# g7 i0 p后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。0 i* Z6 s. H6 @2 s
====
# ~% a3 R  z7 r1 `- y3 z用千问吧,非常稳定,非常强大。
5 l5 o  i& f3 A; H& P0 c9 y7 khttps://chat.qwenlm.ai/
, Z, s" H3 r. K====; x: a" v6 `7 o0 ]$ G) q
Deepseek,API 看上去可用了,但是不给充钱。
( V% f1 j; h8 k1 }+ @6 y9 E1 @* q
* T+ N8 g0 u8 Q0 Q6 W% ^9 w5 w) @# L( B: ~  L$ h0 P
. e, A& V9 H2 I" x" [

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3912 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    2 @2 L: C9 o& x. A1 C这功能很赞呀

    8 v: b* d* c  {6 Y- K简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:131 e; `% B0 d% |' _; k2 l% o
    有没有上传整本书试试
    # p- ~1 Z  J% C, r" ?5 g
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3912 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑   I' j3 a+ j' v& |/ E3 f4 F% [' v
    8 m: F# a2 y3 B- g: Q$ J
    以后让deepseek 读出土的竹简# [8 M3 `7 B0 P" b5 F. N
    0 T) L* b! h" P
    还有把古文翻译成现代白话
    ! E* ^& b3 G3 ]0 e, o$ y6 d% c, O& L
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    前天 18:59
  • 签到天数: 3067 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    " s% q) f5 d0 U7 [$ Z( O3 l; V' \9 H$ O* y
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    5 }, [2 x; a; `, r/ C请教是如何实现的?  v, ^2 N, I% w- O5 c! B0 @
    " C+ ^2 Q) w' m7 R$ i: T
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    / b3 h7 M; C# P% @. S

    3 l: }/ D  [; N- ^/ z我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    + H  f9 O! o& D+ y; |文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    - C! ]2 d+ [( e( q8 v美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。$ u( |( f1 T7 t) l2 I0 U

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    * d( |- F9 g' }" Q请教是如何实现的?
    + J% ~- E' q* X2 C0 t$ P  R6 P8 M' w* v
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    0 q' f4 C1 P. A9 X5 {0 ?+ T) N* }
    https://chat.qwenlm.ai/  y: b- ~$ _7 [% ]
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    ! N2 R5 j2 x4 E很稳定,质量不错,好像最多一次处理15页。8 x' U; k4 G: T
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3174 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    9 m( x" Y- L! Y+ ], m处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。3 A4 Q+ K1 A2 z9 h  u8 D2 @
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    : w. l/ H' n% d1 u% ^0 N! d6 G# Y
    $ q; |0 ?4 V2 ~3 W1 Lhttps://github.com/oomol-lab/pdf-craft
    - m1 f. b, Z' v. Q; `( L4 V
    0 I) U2 s1 J$ p$ {1. 这个工具要求装 python3.10( l% b3 C5 B$ A- g
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0. H2 q" t5 N2 z) B& }* i
    3. pip install pdf-craft
      M6 u9 n) Z3 e4. 把下面的内容写到一个文件里,例如 a.py& m/ n6 U9 K) M& N5 t1 s- s! q& Y

    " R" G0 P( }* W3 L. ?' T! q, H
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter8 L, ]3 A4 v! W
    2. 8 t" `* D1 B/ Q  m0 i
    3. extractor = PDFPageExtractor(
      9 |; q8 I& a; |
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.- a* x+ h8 _$ u/ d9 Z
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed5 n. _3 o6 A4 ~9 b
    6. )
      , [5 x, D0 {7 n% ]! M" `
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:1 F9 a% a  k- k7 V  J9 w; L% P, Z
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):) c3 a/ O% P  B
    9.     md.write(block)
    复制代码

    / \) Y7 i( }" N( `4 _. x% N* G# u9 Y
    要修改的内容:0 U  t) [* l2 F2 E* U+ Q0 S
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    , z* y* B5 Y' z/ w6 C7 T. K* [4.2 markdown_path:输出的 markdown 路径文件名
    5 h# Z( S) d/ T1 P% d  m7 B4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    % o' b( J: t3 g  D( n: Z1 i, Q* \4 n! ~, ?+ |. J2 s
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 ( T( x% \' j( i3 G: M" H
    * @9 m, ~& g, Q6 T$ k2 d/ b$ I
    目前为止PDF转纯文字的最佳办法。) W5 w5 r# E1 ~) Z, n  d
    先写个小程序,把PDF按章节切成小的PDF。
      D* ?5 [* t6 W$ x1 {然后,把PDF一个个传到deepseek,让她抓取,除错,输出。! G1 m. ^0 }5 `+ i/ N. E! Z4 S, z
    效果非常好。+ M: Q7 e. x6 R/ @: i5 ^5 H! q0 Z1 r, G
    ( m: B8 P% H( z2 ]  W& h3 w3 J
    deepseek,qwen,chatgpt 三个,deepseek是最好的。
    & ~8 C  t$ z9 T% N) t$ W* h2 R1 b( E5 ~8 Q* D# }% ~
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    * H$ h/ c6 E/ k% D* o而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。3 G) J. p2 m8 A  I* W" \
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。6 @' k0 s/ M# {6 K& @( |6 Y

    1 l9 G# s0 K) `4 b1 xAPI到目前为止,差强人意,不如网页版本修得干净。& T. l( Z' V9 I* P) C) r) n; L+ j
    ; Z, l. o- j6 {1 ?% B4 _2 G5 |. N
    deepseek可以同时开四个。
    9 M) J9 K" W: L4 `# p# Y

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    $ y0 d# Y0 g7 ~3 P* f) L
    3 q' E. f: }( k3 W+ D8 G让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:268 C! V! K; K4 R! Z3 t
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    ' q, \8 a8 T1 c细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33" }! Q/ g  g1 u. W3 H! a1 x) I& |% `
    细说一下,听上去很不错,多谢。

    - H( z0 h* P& s7 s% B8 c# y9 \直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    8 U' L) v4 l& G8 _5 R2 {
    7 N+ X8 o; c$ Q% C! o, x3 U已经搞定.
    9 T/ A. _0 ~% {; m, v3 E, s# [: n, c2 p. ?3 S
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    5 l5 F/ g9 X. [7 ]# S6 o2 [8 r4 Y' T" x
    1, python + pypdf 按章节拆分小的PDF$ G$ J: C3 {" i# I# d6 m

    ! b9 X% e  K( M6 X5 d6 f4 r% A2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile$ {8 ~( a$ F, w

    - V% R' `7 p) f9 g: O. r; l( W* O得到text file
    " h" p* o. E" @' o' w' c3 r; l* D
    ! ~! z/ [# X3 }4 n3 }) V* t3, python 读取整个outputfile,丢给deepseek 矫正。1 B- t8 P+ t7 d! [) t
    3 }$ H! V2 n4 Y) I
    模型是 deepseek-chat
      h4 J5 X0 q9 k: a" U2 k
    2 u2 _% d) y: g3 nmax_tokens 最大是 8192,别的不用改。% @9 S1 E: i) |. A! U$ F
    # P$ t: U# K. j9 [
    参考:
    6 K! W2 [& G7 X" ]  \https://api-docs.deepseek.com/api/create-chat-completion
    " U# [/ Z! g. e" `! u& G7 K/ g/ C- L4 c1 w! `: t% x( j
    4,费用:
    * t- ~. @7 D% B0 j8 a% Y! F. \9 z1 f
    实测:
    ' v, e1 N1 N) X; f9 |( h* s% }+ o+ @8 @
    296K 字母,用了 9 美分。
    ) d0 @! M% H2 V
    & S% Z3 l9 d0 M' X7 m英文字母 到 token 用量大约 1/3
    2 ^6 h! I6 D) J8 s: ^# p0 q* o0 M: u  _. ]9 S$ y* H
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899- I6 z& h( @5 K
    5 N7 I! U( b7 \$ h/ D. K
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    0 f  b- t; A% G  L9 A: @) h) Q* b' B7 |
    价钱,非常非常便宜了。% j0 m$ H1 R( _) M1 }/ U7 j- p

    * L6 X* ?* }7 B8 F) Y( l参考如下可以计算,懒得算了。; r/ d# m; C4 ^' f& r  H" R
    0 Z8 k; `9 r- w: |9 L* x- u- J
    https://api-docs.deepseek.com/quick_start/pricing1 g! o* G  b8 o9 x
      w& h" ]. L" C1 d
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    3 l: W3 @; V5 K& g3 Q1 h+ \+ p# ?& ^1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    9 U9 A& ?( U0 M* F1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    & `" L7 \6 q8 A6 I# h8 X; P1 f8 g. o7 Z% J4 n$ a- E
    5, Balance5 t4 H/ W) o  d" v" p2 n

    ' c2 w4 u0 e+ g- Q  C5 }可以在程序里调用,知道每次运行结束后,balance还剩多少。
    0 U# U8 r! a5 m+ Y/ ~0 m8 @参考:
    3 l# |/ X2 E  E* a  S8 Y1 G0 ihttps://api-docs.deepseek.com/api/get-user-balance3 I* s+ y8 ]$ e9 e  T

    " e$ O2 m! d  w! G/ B4 v% X0 ?6 `" Y6, Models/ V  ^* q, v$ }0 f  G
    7 f( ?  i! J7 t  k. a4 X
    目前就两个( {9 i3 s8 N; M
    # deepseek-chat
    0 h, Z1 ~* B1 Z% R  s8 i- M# deepseek-reasoner
    - S. x+ u, H! S( K4 X9 p
    # y% _3 ]  ~2 G, Q6 B3 l参考:9 G& u( M! P) ^6 G. o4 @
    https://api-docs.deepseek.com/api/list-models
    8 g( w+ c# N5 a" U, ~$ p1 y0 s: k* R4 f9 F& J7 t" w
    9 P# W" E  @0 M1 q. M- T& w
    7, 问题9 u/ N0 a/ S+ G, w1 P/ O

      ^+ X5 Z2 I# ~0 t, K/ qdeepseek 会将前后两段合成一段。
    1 L6 T$ h; X. C: c8 J特别是那种大量的对话的段落,deepseek会给你合成一大段。
    ( k4 s5 `5 f' `5 s. o$ t7 z" ^/ d( U, `( t+ a% H- U% n
    8, 钱说了算。: T, a' K4 f4 k1 s# G/ f

    6 R3 v6 k4 f/ G% T: Cdeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    ; G7 }6 M3 n2 I; X但是API就不会出现这种情况,毕竟我们给钱了。
    % u' ?/ H; l5 B; J( h4 T( wchatgpt也是这样的。2 w: r) Y9 }, [' b. }

    - v' t3 M8 t0 S$ D
    ( Y1 A! M2 u# f* W, X5 n! h& d$ L

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-21 13:23 , Processed in 0.077065 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表