PDF 轉文字(文字提取 + 掃描件 OCR)

PDF 轉文字(文字提取 + 掃描件 OCR)

【PDF 轉文字】將 PDF 入面嘅文字抽取出嚟,變成你可以複製、編輯同下載嘅文字。工具會逐頁自動判斷:有文字層嘅頁面直接抽取,秒出而且百分百準確;掃描出嚟嘅頁面就自動轉用 OCR 識別。成個過程喺你部機嘅瀏覽器完成,檔案唔會上載到任何伺服器。

PDF 轉文字 · 文字層 + OCR

拉一份 PDF 入嚟,或者撳一下揀檔 最大 50 MB。有文字層嘅 PDF 會即刻抽取;掃描件會自動轉用 OCR。

頁面狀態

文字層(即時) 掃描件(OCR)

TXT

0 字元
0.0 s · 0%

PDF 喺你部機嘅瀏覽器處理,唔會上載到伺服器。處理合約、月結單、醫療報告呢類文件都用得安心。

淨係要抽一張圖或者截圖入面嘅文字?用【圖片轉文字】會快好多 —— 唔使載入 PDF 引擎,仲可以直接 Ctrl+V 貼上截圖。

點樣用

  1. 放份 PDF 入去 — 撳一下拉放區揀檔,或者直接將 PDF 拉入去。
  2. 揀頁數(可以留空)— 寫 1-103、或者 1,5,8-12 都得。留空就處理成份。
  3. 撳「開始轉換」 — 工具會逐頁判斷,完成後右邊出晒文字,可以複製或者下載 .txt。

轉換期間,左邊嘅頁面狀態格會即時變色:綠色代表嗰頁有文字層、直接抽取到;橙色代表嗰頁係掃描件、行緊 OCR。你一眼就知份 PDF 到底係咩嚟。

最重要嘅一件事:你份 PDF 可能根本唔使 OCR

好多人以為 PDF 轉文字一定要 OCR,其實唔係。PDF 分兩種:

文字層 PDF 掃描件 PDF
點嚟 Word/Excel 匯出、網上下載嘅報告、電子帳單、電子書 影印機掃描、手機影相轉 PDF、傳真
入面裝住乜 真正嘅文字資料 一張張圖片
抽取速度 即時,一秒幾十頁 每頁 5–15 秒
準確度 100% 睇圖片質素,通常 85–98%
使唔使載語言檔 唔使 要(約 10–15 MB)

點分辨? 最簡單嘅方法:用普通 PDF 閱讀器打開,試吓用滑鼠選取文字。選得到就係文字層 PDF,選唔到(成頁一齊變藍)就係掃描件。

呢個工具唔使你自己分 —— 佢會逐頁試抽文字層,抽唔到先至轉 OCR。所以一份混合型嘅 PDF(例如前面係打字、後面附咗掃描收據)都處理得到。

頁數點寫

你想要 就寫
全部頁 留空
第 1 至 10 頁 1-10
淨係第 3 頁 3
第 1、5 頁同 8 至 12 頁 1,5,8-12

掃描件一次最多處理 20 頁。 唔係我哋孤寒,係因為 OCR 喺瀏覽器行,一頁大約要 5–15 秒——200 頁嘅話你部機要跑成半個鐘,個 tab 好可能未跑完就已經被系統回收。分批做(1-2021-40)反而穩陣好多。文字層 PDF 就冇呢個限制,幾多頁都得。

如果抽出嚟係亂碼

有時份 PDF 明明「有文字層」,但抽出嚟係一堆符號、問號,或者一篇完全唔通嘅生僻字。呢個唔係工具壞咗,係份 PDF 本身有問題。

PDF 入面嘅嵌入字型,需要一張叫 ToUnicode 嘅對照表,先可以將字型入面嘅字形編號翻譯返做真正嘅文字。中文 PDF 特別容易缺呢張表或者填錯 —— 常見於舊版排版軟件、某啲中文 Word 匯出、傳真轉檔,同埋由第三方軟件事後「加返」文字層嘅掃描件。呢種情況下,文字層係存在嘅,但入面嘅內容係錯嘅。

呢個工具會自動檢查抽出嚟嘅文字係咪可信:如果見到私有區字元、大量替換符號,或者成頁中文都係生僻字,就會當嗰頁係掃描件,自動轉用 OCR,並且喺完成之後話返你知有幾多頁做過呢個回退。

如果自動判斷仲係唔夠準,將上面嘅「模式」轉做「全部用 OCR」 —— 工具會完全唔理文字層,逐頁 render 成圖片再識別。慢好多(每頁 5–15 秒),但遇到壞檔案時最穩陣。

掃描件想準確啲

  1. 揀啱語言 — 只揀份文件真正用到嘅語言。同時揀繁中同簡中會令兩者都變差。
  2. 原始檔愈清晰愈好 — 300 DPI 掃描出嚟嘅 PDF,準確度會明顯高過用手機影相再轉 PDF。
  3. 份文件如果係歪嘅 — OCR 對傾斜好敏感。可以先用 PDF 編輯器將頁面轉正再試。
  4. 表格同多欄排版會亂序 — 呢個係 OCR 嘅先天限制,抽出嚟之後通常要自己執一執。

加密 PDF 點算

如果份 PDF 有開啟密碼,工具會彈出一個密碼欄,你輸入返就可以繼續。密碼同檔案一樣,全程留喺你部機,唔會傳去任何地方。

如果係「唔畀複製」嗰種權限密碼(owner password),因為文件本身開得到,工具通常都抽取到文字。

你份 PDF 唔會離開部機

呢個工具用開源嘅 pdf.js 讀 PDF、Tesseract.js 做 OCR,兩者都喺你部機嘅瀏覽器行,檔案同抽取出嚟嘅文字都唔會上載去任何伺服器

大部分免費線上 PDF 工具都要你將份檔上載到佢哋部伺服器先處理得到 —— 如果你要處理嘅係僱傭合約、銀行月結單、醫療報告、律師信呢啲嘢,呢個分別好重要。

常見問題

PDF 轉文字要收費嗎?有冇頁數限制?

完全免費,唔使註冊。有文字層嘅 PDF 冇頁數限制;掃描件因為要喺瀏覽器行 OCR,一次最多 20 頁,可以分批處理。

我份 PDF 會唔會被上載?

唔會。工具用 pdf.js 同 Tesseract.js,全部喺你部機嘅瀏覽器行,檔案同結果都唔會傳去任何伺服器。

點解有啲 PDF 一秒就出,有啲要等好耐?

因為 PDF 分兩種。文字層 PDF 入面本身就有文字資料,直接讀出嚟就得;掃描件入面淨係圖片,要行 OCR 逐頁識別,每頁大約 5–15 秒。

點知道我份 PDF 係邊種?

用普通 PDF 閱讀器打開,試吓用滑鼠選取文字。選得到就係文字層 PDF,選唔到就係掃描件。不過你唔使自己分——呢個工具會逐頁自動判斷。

有密碼嘅 PDF 得唔得?

得。工具會彈出密碼欄,輸入開啟密碼就可以繼續。密碼全程留喺你部機。

抽出嚟嘅文字係亂碼點算?

將「模式」轉做「全部用 OCR」就可以。亂碼通常係因為份 PDF 嘅嵌入字型缺少 ToUnicode 對照表,令文字層本身就係錯嘅——中文 PDF 特別常見。工具會自動偵測呢種情況並且回退到 OCR,但如果自動判斷唔夠準,手動強制全 OCR 一定得。

排版同表格會唔會保留?

唔會。輸出係純文字(.txt),唔會保留字體、圖片同表格框線。多欄排版同表格嘅閱讀順序有機會會亂,抽出嚟之後通常要自己執一執。

其他你可能用得著嘅工具