【PDF 轉文字】將 PDF 入面嘅文字抽取出嚟,變成你可以複製、編輯同下載嘅文字。工具會逐頁自動判斷:有文字層嘅頁面直接抽取,秒出而且百分百準確;掃描出嚟嘅頁面就自動轉用 OCR 識別。成個過程喺你部機嘅瀏覽器完成,檔案唔會上載到任何伺服器。
PDF 轉文字 · 文字層 + OCR
頁面狀態
TXT
0 字元PDF 喺你部機嘅瀏覽器處理,唔會上載到伺服器。處理合約、月結單、醫療報告呢類文件都用得安心。
1-10、3、或者 1,5,8-12 都得。留空就處理成份。轉換期間,左邊嘅頁面狀態格會即時變色:綠色代表嗰頁有文字層、直接抽取到;橙色代表嗰頁係掃描件、行緊 OCR。你一眼就知份 PDF 到底係咩嚟。
好多人以為 PDF 轉文字一定要 OCR,其實唔係。PDF 分兩種:
| 文字層 PDF | 掃描件 PDF | |
|---|---|---|
| 點嚟 | Word/Excel 匯出、網上下載嘅報告、電子帳單、電子書 | 影印機掃描、手機影相轉 PDF、傳真 |
| 入面裝住乜 | 真正嘅文字資料 | 一張張圖片 |
| 抽取速度 | 即時,一秒幾十頁 | 每頁 5–15 秒 |
| 準確度 | 100% | 睇圖片質素,通常 85–98% |
| 使唔使載語言檔 | 唔使 | 要(約 10–15 MB) |
點分辨? 最簡單嘅方法:用普通 PDF 閱讀器打開,試吓用滑鼠選取文字。選得到就係文字層 PDF,選唔到(成頁一齊變藍)就係掃描件。
呢個工具唔使你自己分 —— 佢會逐頁試抽文字層,抽唔到先至轉 OCR。所以一份混合型嘅 PDF(例如前面係打字、後面附咗掃描收據)都處理得到。
| 你想要 | 就寫 |
|---|---|
| 全部頁 | 留空 |
| 第 1 至 10 頁 | 1-10 |
| 淨係第 3 頁 | 3 |
| 第 1、5 頁同 8 至 12 頁 | 1,5,8-12 |
掃描件一次最多處理 20 頁。 唔係我哋孤寒,係因為 OCR 喺瀏覽器行,一頁大約要 5–15 秒——200 頁嘅話你部機要跑成半個鐘,個 tab 好可能未跑完就已經被系統回收。分批做(1-20、21-40)反而穩陣好多。文字層 PDF 就冇呢個限制,幾多頁都得。
有時份 PDF 明明「有文字層」,但抽出嚟係一堆符號、問號,或者一篇完全唔通嘅生僻字。呢個唔係工具壞咗,係份 PDF 本身有問題。
PDF 入面嘅嵌入字型,需要一張叫 ToUnicode 嘅對照表,先可以將字型入面嘅字形編號翻譯返做真正嘅文字。中文 PDF 特別容易缺呢張表或者填錯 —— 常見於舊版排版軟件、某啲中文 Word 匯出、傳真轉檔,同埋由第三方軟件事後「加返」文字層嘅掃描件。呢種情況下,文字層係存在嘅,但入面嘅內容係錯嘅。
呢個工具會自動檢查抽出嚟嘅文字係咪可信:如果見到私有區字元、大量替換符號,或者成頁中文都係生僻字,就會當嗰頁係掃描件,自動轉用 OCR,並且喺完成之後話返你知有幾多頁做過呢個回退。
如果自動判斷仲係唔夠準,將上面嘅「模式」轉做「全部用 OCR」 —— 工具會完全唔理文字層,逐頁 render 成圖片再識別。慢好多(每頁 5–15 秒),但遇到壞檔案時最穩陣。
如果份 PDF 有開啟密碼,工具會彈出一個密碼欄,你輸入返就可以繼續。密碼同檔案一樣,全程留喺你部機,唔會傳去任何地方。
如果係「唔畀複製」嗰種權限密碼(owner password),因為文件本身開得到,工具通常都抽取到文字。
呢個工具用開源嘅 pdf.js 讀 PDF、Tesseract.js 做 OCR,兩者都喺你部機嘅瀏覽器行,檔案同抽取出嚟嘅文字都唔會上載去任何伺服器。
大部分免費線上 PDF 工具都要你將份檔上載到佢哋部伺服器先處理得到 —— 如果你要處理嘅係僱傭合約、銀行月結單、醫療報告、律師信呢啲嘢,呢個分別好重要。
完全免費,唔使註冊。有文字層嘅 PDF 冇頁數限制;掃描件因為要喺瀏覽器行 OCR,一次最多 20 頁,可以分批處理。
唔會。工具用 pdf.js 同 Tesseract.js,全部喺你部機嘅瀏覽器行,檔案同結果都唔會傳去任何伺服器。
因為 PDF 分兩種。文字層 PDF 入面本身就有文字資料,直接讀出嚟就得;掃描件入面淨係圖片,要行 OCR 逐頁識別,每頁大約 5–15 秒。
用普通 PDF 閱讀器打開,試吓用滑鼠選取文字。選得到就係文字層 PDF,選唔到就係掃描件。不過你唔使自己分——呢個工具會逐頁自動判斷。
得。工具會彈出密碼欄,輸入開啟密碼就可以繼續。密碼全程留喺你部機。
將「模式」轉做「全部用 OCR」就可以。亂碼通常係因為份 PDF 嘅嵌入字型缺少 ToUnicode 對照表,令文字層本身就係錯嘅——中文 PDF 特別常見。工具會自動偵測呢種情況並且回退到 OCR,但如果自動判斷唔夠準,手動強制全 OCR 一定得。
唔會。輸出係純文字(.txt),唔會保留字體、圖片同表格框線。多欄排版同表格嘅閱讀順序有機會會亂,抽出嚟之後通常要自己執一執。