【PDF 转文字】提取 PDF 中的文字,转换成你能复制、编辑和下载的文本。工具会逐页自动判断:有文字层的页面直接提取,秒出而且百分之百准确;扫描出来的页面则自动改用 OCR 识别。整个过程都在你的浏览器中完成,文件不会上传到任何服务器。
PDF 转文字 · 文字层 + OCR
页面状态
TXT
0 字符PDF 在你的浏览器中处理,不会上传到服务器。处理合约、月结单、医疗报告这类文件也能放心使用。
1-10、3,或 1,5,8-12。留空就处理整份。转换过程中,左侧的页面状态方格会实时变色:绿色代表该页有文字层、可直接提取;橙色代表该页是扫描件、正在执行 OCR。你一眼就能看出这份 PDF 到底是什么。
很多人以为 PDF 转文字一定要 OCR,其实不是。PDF 分成两种:
| 文字层 PDF | 扫描件 PDF | |
|---|---|---|
| 来源 | Word/Excel 导出、网上下载的报告、电子账单、电子书 | 复印机扫描、手机拍照转 PDF、传真 |
| 内容本质 | 真正的文字数据 | 一张张图片 |
| 提取速度 | 即时,一秒数十页 | 每页 5–15 秒 |
| 准确度 | 100% | 视图片质量,通常 85–98% |
| 需要下载语言包 | 不需要 | 需要(约 10–15 MB) |
怎么分辨? 最简单的方法:用普通 PDF 阅读器打开,试着用鼠标选取文字。选得到就是文字层 PDF,选不到(整页一起反白)就是扫描件。
这个工具不需要你自己判断 —— 它会逐页先尝试提取文字层,取不到才改用 OCR。所以混合型的 PDF(例如前段是打字内容、后面附上扫描的收据)也能完整处理。
| 你想要 | 就填 |
|---|---|
| 全部页面 | 留空 |
| 第 1 到 10 页 | 1-10 |
| 只要第 3 页 | 3 |
| 第 1、5 页与 8 到 12 页 | 1,5,8-12 |
扫描件一次最多处理 20 页。 这不是小气,而是 OCR 在浏览器中执行,每页需要 5–15 秒——200 页的话你的电脑要跑上半小时,标签页很可能还没跑完就被系统回收了。分批处理(1-20、21-40)反而稳定得多。文字层 PDF 则没有这个限制,多少页都可以。
有时候 PDF 明明「有文字层」,提取出来却是一堆符号、问号,或者一整篇完全不通的生僻字。这不是工具坏了,而是这份 PDF 本身有问题。
PDF 中的嵌入字体,需要一张称为 ToUnicode 的对照表,才能把字体内部的字形编号翻译回真正的文字。中文 PDF 特别容易缺少这张表或填错 —— 常见于旧版排版软件、某些中文 Word 导出、传真转档,以及由第三方软件事后「补上」文字层的扫描件。这种情况下文字层确实存在,但里面的内容是错的。
这个工具会自动检查提取出的文字是否可信:若发现私有区字符、大量替换符号,或整页中文都是生僻字,就会把该页当成扫描件,自动改用 OCR,并在完成后告诉你有几页做过这个回退。
如果自动判断仍然不够准确,请把上方的「模式」切换成「全部使用 OCR」 —— 工具会完全忽略文字层,逐页转成图片再识别。速度慢很多(每页 5–15 秒),但遇到有问题的文件时最稳定。
如果 PDF 设有打开密码,工具会显示一个密码栏,输入后即可继续。密码和文件一样,全程留在你的设备上,不会发送到任何地方。
如果是「禁止复制」那种权限密码(owner password),由于文件本身可以打开,工具通常仍能提取文字。
这个工具使用开源的 pdf.js 读取 PDF、Tesseract.js 执行 OCR,两者都在你的浏览器中运行,文件与提取出的文字都不会上传到任何服务器。
大部分免费在线 PDF 工具都必须把文件上传到他们的服务器才能处理 —— 如果你要处理的是雇佣合约、银行月结单、医疗报告、律师信这类文件,这个差别非常重要。
完全免费,不需要注册。有文字层的 PDF 没有页数限制;扫描件因为要在浏览器执行 OCR,一次最多 20 页,可以分批处理。
不会。工具使用 pdf.js 与 Tesseract.js,全部在你的浏览器中运行,文件与结果都不会发送到任何服务器。
因为 PDF 分成两种。文字层 PDF 本身就含有文字数据,直接读出即可;扫描件内部只有图片,必须逐页执行 OCR,每页大约 5–15 秒。
支持。在「扫描件语言」中选择「马来文 Bahasa Melayu」即可。中英巫混排的文件建议分两次处理,准确度会明显更高。
可以。工具会显示密码栏,输入打开密码即可继续。密码全程留在你的设备上。
把「模式」切换成「全部使用 OCR」即可。乱码通常是因为 PDF 的嵌入字体缺少 ToUnicode 对照表,导致文字层本身就是错的——中文 PDF 特别常见。工具会自动检测这种情况并回退到 OCR,但若自动判断不够准确,手动强制全 OCR 一定有效。
不会。输出是纯文本(.txt),不会保留字体、图片与表格框线。多栏排版与表格的阅读顺序可能会错乱,提取后通常需要自行整理。