圖片轉文字(線上 OCR 文字識別)

圖片轉文字(線上 OCR 文字識別)

【圖片轉文字】係一個免費嘅線上 OCR 工具,可以將圖片、截圖或者相片入面嘅文字抽取出嚟,變成你可以複製、編輯同下載嘅文字。成個識別過程喺你部機嘅瀏覽器完成,圖片唔會上載到任何伺服器。

圖片轉文字 · OCR

拉一張圖片入嚟,或者撳一下揀圖 支援 JPG、PNG、WebP、GIF、BMP。都可以直接撳 Ctrl + V 貼上截圖。
準備識別嘅圖片預覽

TXT

0 字元
0%

圖片喺你部機嘅瀏覽器處理,唔會上載到伺服器。處理身分證、單據、合約呢類文件都用得安心。

要轉成文字嘅係一份 PDF?用【PDF 轉文字】—— 有文字層嘅 PDF 秒出,掃描件會自動用 OCR,唔使你自己逐頁截圖。

點樣用

  1. 放圖片入去 — 撳一下拉放區揀圖、直接將圖片拉入去,或者截咗圖之後撳 Ctrl + V 貼上。
  2. 揀返圖片入面係咩語言 — 語言揀得愈準,識別結果就愈準。
  3. 撳「開始識別」 — 跑完之後,右邊會出晒文字,你可以直接改、複製,或者下載做 .txt 檔。

識別完之後,圖片上面會用綠色框標示佢讀到嘅每一行文字。如果有成段字冇被框住,即係嗰度識別失敗咗——通常係傾斜、太細或者背景太花。

支援嘅格式同語言

項目 支援範圍
圖片格式 JPG、PNG、WebP、GIF、BMP
檔案大小 每張最多 12 MB
語言 繁體中文、簡體中文、英文、日文、韓文

第一次揀某個語言,瀏覽器會下載對應嘅語言檔(中文大約 10–15 MB),所以第一次會慢啲。下載完之後同一次 session 內再識別就快好多。

想準確啲?五個實用貼士

  1. 影相要正 — OCR 對傾斜文字好敏感。相機同紙面平行,比咩後製都有效。
  2. 光線平均 — 避免陰影、反光同閃光燈光斑,呢啲係中文識別最常見嘅失敗原因。
  3. 字愈大愈準 — 圖片入面每個字最好有 20 像素以上高度。細字就開「自動放大細字」,工具會先幫你放大再識別。
  4. 背景愈乾淨愈好 — 花紋底、水印、格線都會令識別出錯。可以先裁走冇用嘅部分。
  5. 唔好貪多揀語言 — 淨係揀圖片真正用到嘅語言。同時揀繁中同簡中反而會令兩者都變差。

你嘅圖片唔會離開部機

呢個工具用開源嘅 Tesseract.js 引擎,整個識別過程都喺你部機嘅瀏覽器行,圖片同識別出嚟嘅文字都唔會上載去任何伺服器,我哋亦都睇唔到你處理過咩。

所以就算你要處理身分證、銀行月結單、單據、醫療紀錄或者合約呢啲敏感文件,都唔使擔心資料交咗畀第三方。(副作用:語言檔下載咗之後,其實斷網都用得。)

OCR 係咩嚟?

OCR 全寫係 Optical Character Recognition,中文叫「光學字元識別」。簡單講,就係將圖片入面「畫」出嚟嘅文字形狀,分析返做電腦真正讀得明、複製得到嘅文字。

對電腦嚟講,一張影住文件嘅相同一張風景相冇分別,都係一堆像素。OCR 做嘅就係將呢啲像素還原做字元——書入面一版、白板上嘅筆記、PDF 截圖、收據、餐牌,以前要自己打返一次,而家撳一撳就抽得出。

要留意 OCR 主要係為印刷體設計,手寫字準確度會低好多,尤其係中文行書草書,基本上識別唔到。

常見問題

圖片轉文字要收費嗎?要唔要註冊?

完全免費,唔使註冊,亦冇次數限制。因為識別喺你部機嘅瀏覽器完成,我哋唔使負擔伺服器成本,所以可以一直免費開放。

我嘅圖片會唔會被上載或者被人睇到?

唔會。呢個工具用 Tesseract.js,所有處理都喺你部機嘅瀏覽器行,圖片同識別結果都唔會傳去任何伺服器。

支唔支援 PDF?

呢個工具本身只處理圖片,不過我哋有另一個【PDF 轉文字】工具專門處理 PDF——有文字層嘅 PDF 秒出,掃描件會自動用 OCR,唔使你自己逐頁截圖。

識別出嚟唔準,點算好?

先試吓開「自動放大細字」,同埋淨係揀圖片真正用到嘅語言。如果仲係唔得,通常係圖片傾斜、太暗或者字太細——重新影一張正面、光線平均嘅相,改善會好明顯。

手寫字識別到嗎?

可以試,但準確度好參差。呢類 OCR 引擎主要為印刷體訓練,工整嘅正楷手寫字有機會讀到部分,行書草書就基本上識別唔到。

點解第一次識別咁耐?

第一次要下載語言檔(中文大約 10–15 MB)同識別引擎。下載完之後,同一次 session 內再識別會快好多。

其他你可能用得著嘅工具