PDF 转文字(文字提取 + 扫描件 OCR)

PDF 转文字(文字提取 + 扫描件 OCR)

【PDF 转文字】提取 PDF 中的文字,转换成你能复制、编辑和下载的文本。工具会逐页自动判断:有文字层的页面直接提取,秒出而且百分之百准确;扫描出来的页面则自动改用 OCR 识别。整个过程都在你的浏览器中完成,文件不会上传到任何服务器。

PDF 转文字 · 文字层 + OCR

把 PDF 拖到这里,或点击选择 最大 50 MB。有文字层的 PDF 会立即提取;扫描件会自动改用 OCR。

页面状态

文字层(即时) 扫描件(OCR)

TXT

0 字符
0.0 s · 0%

PDF 在你的浏览器中处理,不会上传到服务器。处理合约、月结单、医疗报告这类文件也能放心使用。

只是要提取一张图片或截图里的文字?用【图片转文字】会快很多 —— 不必加载 PDF 引擎,还能直接 Ctrl+V 粘贴截图。

使用方法

  1. 放入 PDF — 点击拖放区选择文件,或直接把 PDF 拖进来。
  2. 选择页数(可留空)— 可以填 1-103,或 1,5,8-12。留空就处理整份。
  3. 点击「开始转换」 — 工具会逐页判断,完成后右侧显示文字,可复制或下载成 .txt。

转换过程中,左侧的页面状态方格会实时变色:绿色代表该页有文字层、可直接提取;橙色代表该页是扫描件、正在执行 OCR。你一眼就能看出这份 PDF 到底是什么。

最重要的一件事:你的 PDF 可能根本不需要 OCR

很多人以为 PDF 转文字一定要 OCR,其实不是。PDF 分成两种:

文字层 PDF 扫描件 PDF
来源 Word/Excel 导出、网上下载的报告、电子账单、电子书 复印机扫描、手机拍照转 PDF、传真
内容本质 真正的文字数据 一张张图片
提取速度 即时,一秒数十页 每页 5–15 秒
准确度 100% 视图片质量,通常 85–98%
需要下载语言包 不需要 需要(约 10–15 MB)

怎么分辨? 最简单的方法:用普通 PDF 阅读器打开,试着用鼠标选取文字。选得到就是文字层 PDF,选不到(整页一起反白)就是扫描件。

这个工具不需要你自己判断 —— 它会逐页先尝试提取文字层,取不到才改用 OCR。所以混合型的 PDF(例如前段是打字内容、后面附上扫描的收据)也能完整处理。

页数怎么填

你想要 就填
全部页面 留空
第 1 到 10 页 1-10
只要第 3 页 3
第 1、5 页与 8 到 12 页 1,5,8-12

扫描件一次最多处理 20 页。 这不是小气,而是 OCR 在浏览器中执行,每页需要 5–15 秒——200 页的话你的电脑要跑上半小时,标签页很可能还没跑完就被系统回收了。分批处理(1-2021-40)反而稳定得多。文字层 PDF 则没有这个限制,多少页都可以。

如果提取出来是乱码

有时候 PDF 明明「有文字层」,提取出来却是一堆符号、问号,或者一整篇完全不通的生僻字。这不是工具坏了,而是这份 PDF 本身有问题。

PDF 中的嵌入字体,需要一张称为 ToUnicode 的对照表,才能把字体内部的字形编号翻译回真正的文字。中文 PDF 特别容易缺少这张表或填错 —— 常见于旧版排版软件、某些中文 Word 导出、传真转档,以及由第三方软件事后「补上」文字层的扫描件。这种情况下文字层确实存在,但里面的内容是错的。

这个工具会自动检查提取出的文字是否可信:若发现私有区字符、大量替换符号,或整页中文都是生僻字,就会把该页当成扫描件,自动改用 OCR,并在完成后告诉你有几页做过这个回退。

如果自动判断仍然不够准确,请把上方的「模式」切换成「全部使用 OCR」 —— 工具会完全忽略文字层,逐页转成图片再识别。速度慢很多(每页 5–15 秒),但遇到有问题的文件时最稳定。

扫描件想更准确

  1. 选对语言 — 只选文件真正用到的语言。马来西亚常见的中英巫混排文件建议分两次处理:中文部分选「简体中文 + 英文」,马来文部分选「马来文」,比一次全选准确得多。
  2. 原始文件越清晰越好 — 300 DPI 扫描出来的 PDF,准确度会明显高于用手机拍照再转 PDF。
  3. 文件如果是歪的 — OCR 对倾斜非常敏感。可以先用 PDF 编辑器把页面转正再试。
  4. 表格与多栏排版会乱序 — 这是 OCR 的先天限制,提取后通常需要自己整理一次。

加密的 PDF 怎么办

如果 PDF 设有打开密码,工具会显示一个密码栏,输入后即可继续。密码和文件一样,全程留在你的设备上,不会发送到任何地方。

如果是「禁止复制」那种权限密码(owner password),由于文件本身可以打开,工具通常仍能提取文字。

你的 PDF 不会离开这台设备

这个工具使用开源的 pdf.js 读取 PDF、Tesseract.js 执行 OCR,两者都在你的浏览器中运行,文件与提取出的文字都不会上传到任何服务器

大部分免费在线 PDF 工具都必须把文件上传到他们的服务器才能处理 —— 如果你要处理的是雇佣合约、银行月结单、医疗报告、律师信这类文件,这个差别非常重要。

常见问题

PDF 转文字需要付费吗?有页数限制吗?

完全免费,不需要注册。有文字层的 PDF 没有页数限制;扫描件因为要在浏览器执行 OCR,一次最多 20 页,可以分批处理。

我的 PDF 会被上传吗?

不会。工具使用 pdf.js 与 Tesseract.js,全部在你的浏览器中运行,文件与结果都不会发送到任何服务器。

为什么有些 PDF 一秒就好,有些要等很久?

因为 PDF 分成两种。文字层 PDF 本身就含有文字数据,直接读出即可;扫描件内部只有图片,必须逐页执行 OCR,每页大约 5–15 秒。

支持马来文的扫描件吗?

支持。在「扫描件语言」中选择「马来文 Bahasa Melayu」即可。中英巫混排的文件建议分两次处理,准确度会明显更高。

有密码的 PDF 可以吗?

可以。工具会显示密码栏,输入打开密码即可继续。密码全程留在你的设备上。

提取出来的文字是乱码怎么办?

把「模式」切换成「全部使用 OCR」即可。乱码通常是因为 PDF 的嵌入字体缺少 ToUnicode 对照表,导致文字层本身就是错的——中文 PDF 特别常见。工具会自动检测这种情况并回退到 OCR,但若自动判断不够准确,手动强制全 OCR 一定有效。

排版与表格会保留吗?

不会。输出是纯文本(.txt),不会保留字体、图片与表格框线。多栏排版与表格的阅读顺序可能会错乱,提取后通常需要自行整理。

其他你可能用得上的工具