设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3755|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 1 |3 u  t$ i" p& Y

- ]5 v' L: M' y% J, |( b; J! B4 a把PDF上传,然后让他抓取文字,并修改可能的错误。0 z" R5 h+ l" A3 ?! Y
然后deepseek完美的完成了任务。. i5 b' r$ D# n5 n4 S# n
段落清楚,列清楚,页眉页脚全部去掉。7 h( Y: z# |+ X) b$ M7 g  y7 \
我要疯掉了!
! @$ Q, m6 s/ Q赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!  a% B% K0 ~. {4 I" u: l
====
$ ^8 \5 f1 z2 v9 u# @  n9 B( ^中文也很完美。
& `3 @, l3 B2 `2 Y2 t8 j# c经验值,每次十页比较稳定。" Q1 v. ^1 k+ j. G
现在我这里API还不能用,等恢复了,全自动了。( ]9 r+ J( [/ }- W8 v1 r2 \
====
: p: J+ g+ O0 m3 e; O1 u第二次疯掉了!& W0 J7 r# f( Y
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
7 x2 w7 k* }$ Z! u* O8 b+ X====
: X7 y4 G, y0 G6 v, i+ d* z现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。, E3 D5 W9 H5 z6 h. B; C1 t
但是任务多了后,每次翻译的页面数是减少的。+ w; h: l- J. d- M
好吧,我五体投地,继续探索。
# V% h( `- W' H& C3 V$ u+ N. _% V====
6 h2 t; H: u8 F6 k; J# O8 U为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。# O% X0 d& U0 K6 R
====
; r) `6 d, _2 P  J; d3 Q" ]好吧,有些东西是不给翻译的,哈哈。: t3 E/ {: I3 l3 o3 W

7 g8 n; I& H" c0 z8 vSorry, that's beyond my current scope. Let’s talk about something else.
8 U2 ^! P# P5 r' x====; _$ |9 |! e& F% T4 A$ m% j
然后我的英文命令也让deepseek 帮我修改,呵呵。/ v7 D$ h4 w3 N) D, V
====. Q! k1 Z' A+ d" T& j2 L
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。, X8 N) [) X8 Q' Q/ v4 K9 G0 X3 d
====
5 T! h& e2 C( j8 `. M3 C时间段的话,北京时间的下午和晚上用比较好。, q+ W  w9 v& t6 K. h: _4 ^  t
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。0 l- H& l& }- Y8 L
====2 S7 o9 x0 |8 x3 k
用千问吧,非常稳定,非常强大。; Z! m1 `) }0 T8 @2 z6 `- R
https://chat.qwenlm.ai/
) b0 E, D3 Y1 d* r====" l1 F1 L$ ], W1 F+ C9 ]
Deepseek,API 看上去可用了,但是不给充钱。
1 }7 V7 w" w1 J: N8 ?: D3 V  D1 Y) k
# Z( o' i4 e$ x: Q5 N( R& |5 G
6 G. J  C/ i% {) V: k3 D: t5 V

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    6 小时前
  • 签到天数: 3894 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    / z# H3 l6 d0 a$ g- u5 G7 ^! S! X这功能很赞呀

    0 k1 l" r' S  Q! h; b: U  K简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13- L: j8 A. ]0 `. e1 k/ }
    有没有上传整本书试试

    # e, W; t/ I* z% Q目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    6 小时前
  • 签到天数: 3894 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 6 h- E! v# |& ^. i
    . O# Z9 w' D  Z. J* c" u+ ^
    以后让deepseek 读出土的竹简9 J- u: j# o+ J' @" H
    : M+ R0 y% W8 ]8 Z3 t, i! E
    还有把古文翻译成现代白话* N8 R7 x8 _" J0 w3 a
    # |8 b. Y  R7 h1 L! g6 x
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    昨天 06:02
  • 签到天数: 3055 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?) x0 Z! \2 P) X

    # n) X+ p- P4 e  k+ ?. R我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:234 V' x8 F6 Y+ f. ]0 O6 I9 B( X
    请教是如何实现的?
    . s- [, }# Q8 v- i8 c5 E  U' g! a- ^& x" U
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    # t: n5 a$ a7 q2 p
    $ }% ^8 D- _% o/ U! A1 b0 Z我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。' ]; n4 E+ L  B. d
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。/ }& [% p) T( N
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。8 p- i3 V/ l& a* _9 B4 h

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    2 u) Z8 j9 N7 Z  I; O! b请教是如何实现的?  x' ]& }' F# n! w1 s$ Q
    " G3 A& x1 N! j7 l
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    " X( t+ ?  q, f  h! }
    https://chat.qwenlm.ai/
    ; P4 |" p# c$ J( w; B试一下千问,估计美国人没有攻击他,所以资源敞开用。2 N! k6 a; G0 r# L" B7 c; B- |5 }
    很稳定,质量不错,好像最多一次处理15页。! j3 a9 t( X  ~- A% t5 r
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    6 小时前
  • 签到天数: 3157 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。# S. d- M+ ?/ w* a9 S
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    ! i# Z9 r/ A/ J& u$ ]这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。( Y# ]8 K# t/ s" v

    ! n# R1 U' e  \https://github.com/oomol-lab/pdf-craft
    2 q0 Q% P4 k7 X9 f1 E9 i2 H+ {# d: w9 S( M8 X; _& Z- O
    1. 这个工具要求装 python3.10- J8 N3 [5 A9 k( {: I$ d  C+ P
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0- p3 I$ I- H$ R4 R3 T7 p
    3. pip install pdf-craft1 W* F. @/ \$ t( S; [; D8 \
    4. 把下面的内容写到一个文件里,例如 a.py
    # y1 X2 D9 T' I& a
    9 T; Z6 f: o. K: Z) W
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      ; y- ]" B4 X2 ]* O* y6 H

    2. 7 u/ M5 G4 K" A( e: o
    3. extractor = PDFPageExtractor(
      4 d+ ]* N( P' B6 D; x8 {
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.4 |, E6 s% S8 m% x
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      - k' ]0 x! V! D" S6 X# Z( r. N/ J
    6. )
      1 a, s! m" `" b3 A* _
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:5 l9 H/ U3 {0 E
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      ( T- Q1 A9 p; r' n0 S; M; D8 A
    9.     md.write(block)
    复制代码

    # `; G7 Q" N) M
    " [, e1 T" s& @9 r' R$ z4 L要修改的内容:
    7 V- n+ \3 |5 I+ u/ M. ~4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型: B# w, H" w/ C4 p" ]+ i- J
    4.2 markdown_path:输出的 markdown 路径文件名
    & G/ T7 w3 {, ]) V# U4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    2 o/ s& Z- ~9 L. p! i# F6 s$ r; L
    1 A% k7 ~, V5 v) A: C' A4 a5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 - y! m! S6 P% [3 {

    3 X3 I7 T5 H7 X# C( M目前为止PDF转纯文字的最佳办法。
    6 x# E" l- z+ v- E# }先写个小程序,把PDF按章节切成小的PDF。
    " k2 a# w( B7 a然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    + x% N% \# f0 Q效果非常好。7 [( V4 n+ h* _- F# @# S) `
    ! T9 z4 O& C% l& B
    deepseek,qwen,chatgpt 三个,deepseek是最好的。
    " H$ T/ L, U' B: O1 g' `
      D* V. f2 C4 K' |, c. e7 vdeepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    7 O6 b. W: o* I$ [( F) y2 C$ q而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    " O" ^+ y% k+ r! @2 f3 T* O$ J我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。( R. ^" `9 H8 x0 ^( U
    % L! ?% e! p4 H8 q! Q6 Q' [8 z
    API到目前为止,差强人意,不如网页版本修得干净。- I) m6 c8 ]7 M: {: ~1 m. [

    ) l1 t: P2 ]6 ^$ ]! ?( jdeepseek可以同时开四个。
    0 E# T  s' K: u/ G

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 ' U6 X# x! _4 `9 A
    ) F2 ~: d6 B+ @  C+ d! ^9 [& F
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    % X& N8 ~% K, x' @$ \让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    7 |( E' [3 F( M" O. f. {4 R4 C细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33. _# J6 z) t5 U/ U" y7 R
    细说一下,听上去很不错,多谢。

    ( X% H# [5 \/ ~, D9 D5 g! v, X2 D! Q) F直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
      s) m% R  a6 _- r1 O9 z9 M* ^; {& J/ r+ ]
    已经搞定.9 H3 W! d: V: M
    / \9 N% x! R$ }) k! n2 q
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    " I& \! K( E' i: _+ P' ?
    ( Z: J4 F. L- v( x& k8 \/ v$ t1, python + pypdf 按章节拆分小的PDF
    8 m, A% L/ E; R/ L4 W6 z6 B, ?% V" W3 C" b) v
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
      J+ Q5 Q. o) o5 r  f+ d
    8 J& @" I9 I2 e5 ~7 f$ }得到text file
    4 @$ e7 J! {- w
    8 e9 |. B# q8 ?. |- E4 k3, python 读取整个outputfile,丢给deepseek 矫正。% N; g8 _9 s/ ]0 Z. [

    : k9 ~- i5 ^0 w模型是 deepseek-chat( ?( t7 I" x1 ?; [
    7 y9 r' N8 }+ ?6 L  [$ g, x
    max_tokens 最大是 8192,别的不用改。  M- `. Z! _. X% k2 C' N* g
    4 ]9 S1 Q0 U! m7 B) g1 F% Q
    参考:
    - S4 L4 e1 U. a' r9 N/ M4 e1 Khttps://api-docs.deepseek.com/api/create-chat-completion* G8 n) u& f: s5 ~9 r" f1 D

    ; Q' w' N4 F) ]% b7 B4,费用:
    & f5 R0 U  m4 K7 w& z! J+ ~( B  f, {: O. t% h, o* X9 k; h
    实测:# W' h2 f$ G1 I$ z- Z" E- u6 R! {
    6 @- e0 r4 A  d+ M
    296K 字母,用了 9 美分。4 O+ c# N: U$ l! x/ X
    - y; W# `3 K6 t$ ^
    英文字母 到 token 用量大约 1/3
    ) P8 ?# `9 t: Y+ e- h/ Q3 K  M, c3 C! F
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    ' g) x, K" u5 L$ w3 m- V- Y2 u& O+ d9 V$ K5 Z- J* z# w9 b) g: {9 v  w+ V
    32899 个字母花费 11782 tokens,包含输入输出的 tokens2 y6 x% O  O4 \2 K; t# E! F' @; m
    % b% k3 b' d' P$ v# m$ _* S
    价钱,非常非常便宜了。
    8 Q' E7 i) X% o3 o/ I$ M/ F: q# D3 X6 I8 S/ v' q
    参考如下可以计算,懒得算了。
    , b  F7 ]- A, ?0 q: y7 Y1 m7 H" c/ @( H! n, J( d* T6 x; ~2 ]
    https://api-docs.deepseek.com/quick_start/pricing
    3 V0 n. ^; I! `+ [0 t; i) L! b- ^7 _6 Y6 r
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    & u0 A* a6 z1 C6 _2 D1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55) ]- q9 @3 ]1 U/ E5 d. e' s3 d( I# Z
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19! U8 f9 U6 x; G- R) Z, B
    / ?( \' K/ r2 ~! _3 r( g! v3 t
    5, Balance! F/ A5 W# }# B3 y* h+ n, }
    * g6 J( B- Z3 H& y+ @
    可以在程序里调用,知道每次运行结束后,balance还剩多少。4 O% A1 H8 L7 g* {- m2 o# M$ v% d
    参考:
    4 g0 L7 r1 O* rhttps://api-docs.deepseek.com/api/get-user-balance( R1 i; e: K  a- \

    2 v8 |! j& Q6 ^$ D' v8 Z" X' X6, Models* s. O9 n$ ^4 p7 [; T
    1 S9 `$ X2 T9 z
    目前就两个1 h- E/ E4 w" F, H4 m; j* t0 ?
    # deepseek-chat
      H0 b! b' m/ A' k$ a5 P) k# deepseek-reasoner5 I) F8 l8 U# ~* J; k  n& }- J9 y8 E
    5 p( @" b9 d6 I7 D: S: j  N
    参考:
    ) I6 e3 L& T) q/ jhttps://api-docs.deepseek.com/api/list-models
    5 y6 Q' Z% A" }- Z+ Y1 m4 X' {  e2 r. A+ m. F3 W
    5 H9 V( D! e* u1 x
    7, 问题
    6 l5 \; A: J' [/ P9 A* Z- ]1 d  X; x
    deepseek 会将前后两段合成一段。
      P1 a" H& k' r$ C6 C特别是那种大量的对话的段落,deepseek会给你合成一大段。, k$ L6 e; J$ K& W

    6 r2 ~' Z; U. N2 B7 o" z, i8, 钱说了算。" b- M/ o( I6 X1 z; w! l6 m" N- U
    3 M3 H3 v/ {; Z5 B: J& C# k+ m
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。$ l- |( B& O/ Z2 l$ x
    但是API就不会出现这种情况,毕竟我们给钱了。
    % K3 T5 [5 T7 i, schatgpt也是这样的。2 s; T. l1 R, Q' B! {8 q
    2 a! j+ |! j7 G- K7 V5 V

    ' j& _& v" z8 E% g$ \( |7 N$ m

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-3 06:39 , Processed in 0.070018 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表