Python_文字識別引擎試用:tesseract-ocr

來源:互聯網
上載者:User

   tesseract-ocr是一 個OCR引擎,在1985年到1995年由HP實驗室開發,後來由google開發並且開源,支援多平台,支援多達40種語言,其中包括中文,支援訓練,tesseract-ocr是一個命令列程式,但是也提供多種語言的封裝器,如.Net
、Python、Ruby、C、Java,方便整合到程式中使用。

命令列調用很簡單:

tesseract.exe <image> <outputName> [-l lang] [configs]

<image>:要識別的圖片路徑

<outputName>:命令列模式下,tesseract會把識別出來的文字結果儲存在一個文字檔中,outputName是該檔案的名字,如果值為“lixin”,那麼結果會儲存在程式根目錄下的lixin.txt檔案中。

[-l lang]:預設情況下內建了英文的字典,如果想識別中文或者其他語言,需要在下載相應的語言套件,並存放在程式“/tessdata”目錄下,例如我下載了一個簡體中文包,檔案名稱為“chi_sim.traineddata”,解壓到“tessdata”目錄下,然後該值為:“-l chi_sim”。

[configs]:配置項。

調用的例子: tesseract.exe d:\test.jpg resultFile –l chi_sim

        經過測試,英文的識別率還是比較高的,但在字型比較小的情況下,識別率很差,我在記事本上輸入自己的手機號碼,10px字型,然後測試,發現識別錯誤,接著我把原圖進行放大到200%,再進行測試,則識別正確;測試中文時,識別率沒有英文高,而且同樣存在字型不夠大時識別錯誤率高,通過放大圖片或者字型均能提高識別率,常規的驗證碼識別沒問題,但是連體字元則無法識別

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.