【PDF 轉文字】擷取 PDF 中的文字,轉換成你能複製、編輯與下載的文字檔。工具會逐頁自動判斷:有文字層的頁面直接擷取,秒出而且百分之百準確;掃描出來的頁面則自動改用 OCR 辨識。整個過程都在你的瀏覽器完成,檔案不會上傳到任何伺服器。
PDF 轉文字 · 文字層 + OCR
頁面狀態
TXT
0 字元PDF 在你的瀏覽器處理,不會上傳到伺服器。處理合約、對帳單、醫療報告這類文件也能安心使用。
1-10、3,或 1,5,8-12。留空就處理整份。轉換過程中,左側的頁面狀態方格會即時變色:綠色代表該頁有文字層、可直接擷取;橘色代表該頁是掃描檔、正在執行 OCR。你一眼就能看出這份 PDF 到底是什麼。
很多人以為 PDF 轉文字一定要 OCR,其實不是。PDF 分成兩種:
| 文字層 PDF | 掃描檔 PDF | |
|---|---|---|
| 來源 | Word/Excel 匯出、網路上下載的報告、電子帳單、電子書 | 影印機掃描、手機拍照轉 PDF、傳真 |
| 內容本質 | 真正的文字資料 | 一張張圖片 |
| 擷取速度 | 即時,一秒數十頁 | 每頁 5–15 秒 |
| 準確度 | 100% | 視圖片品質,通常 85–98% |
| 需要下載語言檔 | 不需要 | 需要(約 10–15 MB) |
怎麼分辨? 最簡單的方法:用一般 PDF 閱讀器開啟,試著用滑鼠選取文字。選得到就是文字層 PDF,選不到(整頁一起反白)就是掃描檔。
這個工具不需要你自己判斷 —— 它會逐頁先嘗試擷取文字層,取不到才改用 OCR。所以混合型的 PDF(例如前段是打字內容、後面附上掃描的收據)也能完整處理。
| 你想要 | 就填 |
|---|---|
| 全部頁面 | 留空 |
| 第 1 到 10 頁 | 1-10 |
| 只要第 3 頁 | 3 |
| 第 1、5 頁與 8 到 12 頁 | 1,5,8-12 |
掃描檔一次最多處理 20 頁。 這不是小氣,而是 OCR 在瀏覽器中執行,每頁需要 5–15 秒——200 頁的話你的電腦要跑上半小時,分頁很可能還沒跑完就被系統回收了。分批處理(1-20、21-40)反而穩定得多。文字層 PDF 則沒有這個限制,多少頁都可以。
有時候 PDF 明明「有文字層」,擷取出來卻是一堆符號、問號,或者一整篇完全不通的生僻字。這不是工具壞了,而是這份 PDF 本身有問題。
PDF 中的嵌入字型,需要一張稱為 ToUnicode 的對照表,才能把字型內部的字形編號翻譯回真正的文字。中文 PDF 特別容易缺少這張表或填錯 —— 常見於舊版排版軟體、某些中文 Word 匯出、傳真轉檔,以及由第三方軟體事後「補上」文字層的掃描檔。這種情況下文字層確實存在,但裡面的內容是錯的。
這個工具會自動檢查擷取出的文字是否可信:若發現私有區字元、大量替換符號,或整頁中文都是生僻字,就會把該頁當成掃描檔,自動改用 OCR,並在完成後告訴你有幾頁做過這個回退。
如果自動判斷仍然不夠準確,請把上方的「模式」切換成「全部使用 OCR」 —— 工具會完全忽略文字層,逐頁轉成圖片再辨識。速度慢很多(每頁 5–15 秒),但遇到有問題的檔案時最穩定。
如果 PDF 設有開啟密碼,工具會顯示一個密碼欄位,輸入後即可繼續。密碼和檔案一樣,全程留在你的電腦上,不會傳送到任何地方。
如果是「禁止複製」那種權限密碼(owner password),由於文件本身可以開啟,工具通常仍能擷取文字。
這個工具使用開源的 pdf.js 讀取 PDF、Tesseract.js 執行 OCR,兩者都在你的瀏覽器中運行,檔案與擷取出的文字都不會上傳到任何伺服器。
大部分免費線上 PDF 工具都必須把檔案上傳到他們的伺服器才能處理 —— 如果你要處理的是勞動契約、銀行對帳單、醫療報告、律師函這類文件,這個差別非常重要。
完全免費,不需註冊。有文字層的 PDF 沒有頁數限制;掃描檔因為要在瀏覽器執行 OCR,一次最多 20 頁,可以分批處理。
不會。工具使用 pdf.js 與 Tesseract.js,全部在你的瀏覽器中執行,檔案與結果都不會傳送到任何伺服器。
因為 PDF 分成兩種。文字層 PDF 本身就含有文字資料,直接讀出即可;掃描檔內部只有圖片,必須逐頁執行 OCR,每頁大約 5–15 秒。
用一般 PDF 閱讀器開啟,試著用滑鼠選取文字。選得到就是文字層 PDF,選不到就是掃描檔。不過你不需要自己判斷——這個工具會逐頁自動處理。
可以。工具會顯示密碼欄位,輸入開啟密碼即可繼續。密碼全程留在你的電腦上。
把「模式」切換成「全部使用 OCR」即可。亂碼通常是因為 PDF 的嵌入字型缺少 ToUnicode 對照表,導致文字層本身就是錯的——中文 PDF 特別常見。工具會自動偵測這種情況並回退到 OCR,但若自動判斷不夠準確,手動強制全 OCR 一定有效。
不會。輸出是純文字(.txt),不會保留字體、圖片與表格框線。多欄排版與表格的閱讀順序可能會錯亂,擷取後通常需要自行整理。