PDF 轉文字(文字擷取 + 掃描檔 OCR)

PDF 轉文字(文字擷取 + 掃描檔 OCR)

【PDF 轉文字】擷取 PDF 中的文字,轉換成你能複製、編輯與下載的文字檔。工具會逐頁自動判斷:有文字層的頁面直接擷取,秒出而且百分之百準確;掃描出來的頁面則自動改用 OCR 辨識。整個過程都在你的瀏覽器完成,檔案不會上傳到任何伺服器。

PDF 轉文字 · 文字層 + OCR

將 PDF 拖曳到這裡,或點一下選擇 最大 50 MB。有文字層的 PDF 會立即擷取;掃描檔會自動改用 OCR。

頁面狀態

文字層(即時) 掃描檔(OCR)

TXT

0 字元
0.0 s · 0%

PDF 在你的瀏覽器處理,不會上傳到伺服器。處理合約、對帳單、醫療報告這類文件也能安心使用。

只是要擷取一張圖片或截圖裡的文字?用【圖片轉文字】會快很多 —— 不必載入 PDF 引擎,還能直接 Ctrl+V 貼上截圖。

使用方法

  1. 放入 PDF — 點一下拖放區選擇檔案,或直接把 PDF 拖進來。
  2. 選擇頁數(可留空)— 可以填 1-103,或 1,5,8-12。留空就處理整份。
  3. 按下「開始轉換」 — 工具會逐頁判斷,完成後右側顯示文字,可複製或下載成 .txt。

轉換過程中,左側的頁面狀態方格會即時變色:綠色代表該頁有文字層、可直接擷取;橘色代表該頁是掃描檔、正在執行 OCR。你一眼就能看出這份 PDF 到底是什麼。

最重要的一件事:你的 PDF 可能根本不需要 OCR

很多人以為 PDF 轉文字一定要 OCR,其實不是。PDF 分成兩種:

文字層 PDF 掃描檔 PDF
來源 Word/Excel 匯出、網路上下載的報告、電子帳單、電子書 影印機掃描、手機拍照轉 PDF、傳真
內容本質 真正的文字資料 一張張圖片
擷取速度 即時,一秒數十頁 每頁 5–15 秒
準確度 100% 視圖片品質,通常 85–98%
需要下載語言檔 不需要 需要(約 10–15 MB)

怎麼分辨? 最簡單的方法:用一般 PDF 閱讀器開啟,試著用滑鼠選取文字。選得到就是文字層 PDF,選不到(整頁一起反白)就是掃描檔。

這個工具不需要你自己判斷 —— 它會逐頁先嘗試擷取文字層,取不到才改用 OCR。所以混合型的 PDF(例如前段是打字內容、後面附上掃描的收據)也能完整處理。

頁數怎麼填

你想要 就填
全部頁面 留空
第 1 到 10 頁 1-10
只要第 3 頁 3
第 1、5 頁與 8 到 12 頁 1,5,8-12

掃描檔一次最多處理 20 頁。 這不是小氣,而是 OCR 在瀏覽器中執行,每頁需要 5–15 秒——200 頁的話你的電腦要跑上半小時,分頁很可能還沒跑完就被系統回收了。分批處理(1-2021-40)反而穩定得多。文字層 PDF 則沒有這個限制,多少頁都可以。

如果擷取出來是亂碼

有時候 PDF 明明「有文字層」,擷取出來卻是一堆符號、問號,或者一整篇完全不通的生僻字。這不是工具壞了,而是這份 PDF 本身有問題。

PDF 中的嵌入字型,需要一張稱為 ToUnicode 的對照表,才能把字型內部的字形編號翻譯回真正的文字。中文 PDF 特別容易缺少這張表或填錯 —— 常見於舊版排版軟體、某些中文 Word 匯出、傳真轉檔,以及由第三方軟體事後「補上」文字層的掃描檔。這種情況下文字層確實存在,但裡面的內容是錯的。

這個工具會自動檢查擷取出的文字是否可信:若發現私有區字元、大量替換符號,或整頁中文都是生僻字,就會把該頁當成掃描檔,自動改用 OCR,並在完成後告訴你有幾頁做過這個回退。

如果自動判斷仍然不夠準確,請把上方的「模式」切換成「全部使用 OCR」 —— 工具會完全忽略文字層,逐頁轉成圖片再辨識。速度慢很多(每頁 5–15 秒),但遇到有問題的檔案時最穩定。

掃描檔想更準確

  1. 選對語言 — 只選文件真正用到的語言。同時選繁體與簡體會讓兩者都變差。
  2. 原始檔越清晰越好 — 300 DPI 掃描出來的 PDF,準確度會明顯高於用手機拍照再轉 PDF。
  3. 文件如果是歪的 — OCR 對傾斜非常敏感。可以先用 PDF 編輯器把頁面轉正再試。
  4. 表格與多欄排版會亂序 — 這是 OCR 的先天限制,擷取後通常需要自己整理一次。

加密的 PDF 怎麼辦

如果 PDF 設有開啟密碼,工具會顯示一個密碼欄位,輸入後即可繼續。密碼和檔案一樣,全程留在你的電腦上,不會傳送到任何地方。

如果是「禁止複製」那種權限密碼(owner password),由於文件本身可以開啟,工具通常仍能擷取文字。

你的 PDF 不會離開這台電腦

這個工具使用開源的 pdf.js 讀取 PDF、Tesseract.js 執行 OCR,兩者都在你的瀏覽器中運行,檔案與擷取出的文字都不會上傳到任何伺服器

大部分免費線上 PDF 工具都必須把檔案上傳到他們的伺服器才能處理 —— 如果你要處理的是勞動契約、銀行對帳單、醫療報告、律師函這類文件,這個差別非常重要。

常見問題

PDF 轉文字需要付費嗎?有頁數限制嗎?

完全免費,不需註冊。有文字層的 PDF 沒有頁數限制;掃描檔因為要在瀏覽器執行 OCR,一次最多 20 頁,可以分批處理。

我的 PDF 會被上傳嗎?

不會。工具使用 pdf.js 與 Tesseract.js,全部在你的瀏覽器中執行,檔案與結果都不會傳送到任何伺服器。

為什麼有些 PDF 一秒就好,有些要等很久?

因為 PDF 分成兩種。文字層 PDF 本身就含有文字資料,直接讀出即可;掃描檔內部只有圖片,必須逐頁執行 OCR,每頁大約 5–15 秒。

怎麼知道我的 PDF 是哪一種?

用一般 PDF 閱讀器開啟,試著用滑鼠選取文字。選得到就是文字層 PDF,選不到就是掃描檔。不過你不需要自己判斷——這個工具會逐頁自動處理。

有密碼的 PDF 可以嗎?

可以。工具會顯示密碼欄位,輸入開啟密碼即可繼續。密碼全程留在你的電腦上。

擷取出來的文字是亂碼怎麼辦?

把「模式」切換成「全部使用 OCR」即可。亂碼通常是因為 PDF 的嵌入字型缺少 ToUnicode 對照表,導致文字層本身就是錯的——中文 PDF 特別常見。工具會自動偵測這種情況並回退到 OCR,但若自動判斷不夠準確,手動強制全 OCR 一定有效。

排版與表格會保留嗎?

不會。輸出是純文字(.txt),不會保留字體、圖片與表格框線。多欄排版與表格的閱讀順序可能會錯亂,擷取後通常需要自行整理。

其他你可能用得到的工具