-- PDF檔案格式轉換心得
世事無絕對,首先解密方面,試過幾種軟體,最好用的還是Passware_Acrobat Key,其次是Adult PDF Password Recovery v2.2.0和PDF Password Remover v2.2,再次,至於映像掃描的文本轉換,中文的話,比較麻煩,將圖片存為不壓縮的TIF格式,用清華TH-OCR 9.0版或者漢王文本王進行識別轉換,如只是部分識別也可以不存圖片,用文通慧視小靈鼠進行螢幕捕獲識別,上面這3個OCR軟體可以在VeryCD.Com上面下載,如果是文字格式設定可用Solid Converter PDF轉換成Word編輯翻譯,不過,Solid Converter PDF支援的語言較多,英文和繁體中文應該也沒問題,至於英文方面,文字格式設定的PDF可以通過ABBYY PDF Transformer 1.0進行文本轉換,格式為RTF可以在Word中編輯,映像格式可以使用最近剛推出的OCR軟體_IRIS Readiris Pro v10.0,速度效果都還不錯,最後翻譯軟體方面就看大家自己的喜好了。以上是個人的小小心得,僅供各位參考!
最新動向的Recosoft PDF2Office Personal v2.0軟體也可以將PDF檔案轉換成DOC格式,也支援中文,如果有專業版就更好了。IRIS Readiris Pro v10.0也有亞洲語言支援包OCR,如果可以下載到帶Keygen的最新版本就可以轉換中文了!目前看來只有再等等看了!
部分軟體可以在eastgame.net的ISO和0day下載到,也可以去Verycd.com找不到部分!
如果是英文就太簡單了,
Abbyy.FineReader.v7.0.Professional可以直接將圖片形式的PDF轉化為DOC,
而且文字和圖表的格式都基本不變,
可惜的是FineReader連祖魯語都支援,
就是不支援中文。
abbyy
http://www.russky.net/down/list.asp?id=296
所以中文稍微複雜一些,
先用Adobe Acrobat 5.0/6.0將PDF另存新檔JPG,
然後想怎麼OCR就怎麼OCR了,
Ken推薦的漢王6.0不錯,
我用過的所有中文OCR軟體中最好的。
看清楚,
是Adobe Acrobat,
不是Acrobat Reader哈!
簡介:
OCR是英文Optical Character Recognition的縮寫,意思為光學字元辨識,通稱為文字識別,它的工作原理為通過掃描器或數位相機等光學輸入裝置擷取紙張上的文字圖片資訊,利用各種模式識別演算法分析文字形態特徵,判斷出漢字的標準編碼,並按通用格式儲存在文字檔中,由此可以看出,OCR實際上是讓電腦認字,實現文字自動輸入。它是一種快捷、省力、高效的文字輸入方法。
工具:
1,清華文通Th-OCR 9.0
TH-OCR是清華大學自1985年就開始研發的,TH是TsingHua(清華)的縮寫,TH-OCR代表北京清華紫光文通訊息技術有限公司開發的OCR軟體。在國家“863”計劃支援下,持續了十多年的科研成果,從1.0版本開始已經升級到現在的9.0版本。獨家真正實現了漢英混排同時識別,在國際上首次突破了OCR產品只能處理漢字或英文單一文字的局限性,新增了東方文字(簡繁漢、日文、韓文)識別功能,對日文和韓文與英文混排文檔的識別水平甚至超過日本和韓國對本國文字的識別水平,在國內、外產生了重大的影響,並連續3年被中國軟體行業協會評為優秀軟體產品,成為漢字輸入技術的一座裡程碑。TH-OCR9.0版本已應用到了包括電子政務、電子出版物、報社、銀行、郵政、稅務、圖書館等多個領域,成為國內OCR市場的先鋒。
本屆兩會代表的所有提案全部採用了我國自主智慧財產權的世界識別領域領先產品——清華紫光文通的TH-OCR9.0進行錄入識別,它以準確的識別率、優異的識別速度博得了兩會工作人員的交口稱讚。而清華TH-OCR技術在兩會上的成功應用更論證了我國也完全有實力擁有自己的卓越技術。
TH-OCR的突出特點:
◇ 漢英雙語同時混排,識別率最高,居世界領先水平。
◇ 可以識別黑白、灰階、彩色映像,可以讀取多種映像格式。
◇ 首創對識別結果進行電子文檔版面複原功能,所見即所得 (WYSIWYG)。
◇ 首創日文、韓文、日英混排、韓英混排識別功能,識別率98%以上。
TH-OCR的六大優勢:
1. 是唯一可以識別2萬多漢字的多體文字識別系統,漢字識別國內最優。
2. 漢字和英文混排、日文和英文混排、韓文和英文混排同時識別。
3. 漢字識別率最高。清華紫光文通TH-OCR經過"863"智能專家組對數十萬字的指標評測和中國軟體評測中心對產品的嚴格測試,識別正確率超過99.5%,代表了目前印刷體文字識別的最高水平。
4. 支援多種環境介面。清華紫光文通TH-OCR支援WINDOWS環境和GB、BIG5、GBK、JIS、 SHIFT-JIS和KSC等多種內碼,可以用於 WINDOWS NT和WINDOWS 98/2000/XP,適合全球各個地區使用。TH-OCR還具有自學習功能,不論什麼生僻字,都可以通過鍵盤輸入進行學習,大大拓寬了OCR系統的識別字元集。
5. 曆次國內評鑑均被中國科學院院土和中國工程院院土等專家組成的評鑑委員會評定為“具有世界領先水平”。
原版地址: http://www.downxp.com/soft/4839.htm
破解下載: http://www.ihdown.com/soft/2252.htm 選擇第三個連結下載即可
說明:把下載的winocr.exe檔案放到安裝的目錄裡面,運行即可winocr.exe即可,不要刪除和運行winocr32.exe.如果你以前安裝過其他的破解補丁,請卸載軟體重新安裝原始版本.因為程式有自校檢功能所以不要把winocr32.exe檔案刪除和修改.運行補丁包的winocr.exe檔案即可.修改捷徑指向winocr.exe即可(原來指向winocr32.exe)沒有字型限制,沒有掃描限制,沒有通用錯誤警告,完美破解
這是最新的破解版,據說沒有任何限制了,我試了一下,在大量匯出為RTF格式時仍會出錯。
漢王和紫光各有千秋,喜歡紫光的就去下吧。
2,漢王文豪5800
文豪5800除了具備文本王經典版的各項功能,諸如操作簡單快捷、一鍵即可實現掃描識別輸出到Word文檔外,它還能準確識別各種表格和映像,並新增加了批量工程處理、表格拼接、ACDSee圖文索引和摘抄高手等人性化的功能設計。它配備了一台光學解析度為1200dpi×2400dpi、48位色彩增強技術、USB2.0介面的超薄高速掃描器,對印刷文稿的識別率能達到99.5%以上,能夠輕鬆識別百餘種印刷字型和各種圖文混排格式的文本。
對於有批量錄入需求的使用者來說,文豪5800的“工程檔案”能夠解決批量錄入中的很多問題,它能將工作進度自動進行儲存,使用者再次開啟此項工程的時候它就能自動指向工作的斷點,免去了重複尋找、識別、校對的麻煩。
要提醒使用者的是:如果想將掃描的文字或者表格直接轉換為doc、rtf、txt等格式儲存的話,一定要注意印刷品的放置方向,如果方向反了的話,識別出來的文字會全部都是亂碼,雖然在掃描器上有印刷品放置方向的提示,但是若非實際使用,使用者很難把握怎樣放置才能得到正確的掃描輸出結果——這也在一定程度上反應出產品細節設計的不足。
總體而言,漢王文本王文豪5800在識別印刷品的時候識別率高,識別速度也比較快,對於有大量文字錄入需求以及需要將傳統印刷品轉換為電子檔的使用者來說,漢王文本王文豪5800是一個非常不錯的選擇。不過整體來看,文豪5800的配套軟體設計得還不夠精緻,介面不夠美觀,風格也不夠統一,很多細微的地方應該加以改進。和漢王名片通的配套管理軟體比較起來,漢王文本王文豪5800的配套軟體顯然要遜色得多。
漢王文本王文豪5800的使用比較簡單,其配套的印刷版使用手冊圖文並茂,對硬體安裝和軟體使用進行了非常詳盡的介紹;電子協助文檔比較簡單。
簡單描述:文稿表格快速錄入
一鍵掃入
WORD輸出
省去了傳統掃描錄入時的灰階調整
傾斜校正等很多步驟
可實現1000頁稿件的批量識別錄入
最高速度可達6000字/分鐘
文表圖只需按一鍵就"複印"入WORD!
:
漢王文豪5800: http://www.piaodown.com/down/soft/12609.htm
漢王文豪5300:http://www.ddooo.com/softdown/28133.htm
漢王OCR2.5:ftp://software@211.147.168.80/pic/hwdoc.rar
漢王OCR2.5安裝說明:
下載的壓縮包解壓後應該有三個檔案:hwdocSetup檔案夾、HWDOC 升級2.5.exe、漢王文本王2.5掃描器破解程式_crk.exe。
安裝順序:
1,先安裝hwdocSetup檔案夾中的漢王2.3主程式
2,運行“HWDOC 升級2.5.exe”進行升級
3,運行“漢王文本王2.5掃描器破解程式_crk.exe”進行破解
一切OK!!!
雖然漢王巳出了5300、5800、6800,但真正完全破解的只有漢王OCR2.5。我喜歡用漢王,5300和5800的OCR核心似乎相同,破解也是相同的,據說是完全破解,但批量處理時仍會出錯,所以我還是用2.5的。
3,ABBYY FineReader OCR Professional 7.0
ABBYY FineReader 7.0專業版是最新、最準確的ABBYY OCR軟體版本。它可以為使用者提供最進階別識字精確率,是一個非常節省時間的好方案。FineReader允許你將各種紙張和電子檔案轉換、編輯以及重新使用,包括:雜誌、報紙、傳真、複製和PDF檔案。
: http://www.onlinedown.net/soft/24081.htm
慧視小靈鼠
螢幕文字識別系統,可以從數位相機等各種裝置攝取的圖片中識別文字資訊;聯機手寫文字識別系統, 可以脫離手寫板的限制,任意書寫文字。慧視-小靈鼠(包括螢幕取字和滑鼠手寫輸入等新技術)
將Disk1.rar至Disk6.rar下載後,解壓縮到統一檔案夾內, 然後運行Disk1目錄下的Setup.exe
:
http://www.wintone.com.cn/html/service/downlist.asp?channelid=12&catid=21&id=341
1: http://www.wintone.com.cn/html/service/download/disk1.rar
2: http://www.wintone.com.cn/html/service/download/disk2.rar
3: http://www.wintone.com.cn/html/service/download/disk3.rar
4: http://www.wintone.com.cn/html/service/download/disk4.rar
5: http://www.wintone.com.cn/html/service/download/disk5.rar
6: http://www.wintone.com.cn/html/service/download/disk6.rar
我試用了一下,很好用,用於摘抄非常方便,對於那些不能直接COPY的文字,用“慧視”是最方便不過了,省去了文字的輸入過程。但美中不足的是不能用於批量識別,校對也不是太方便。要用於批量檔案識別,還是漢王好。
其它還有:尚書OCR、漢王OCR、蒙怡OCR、丹青OCR等。
OCR軟體使用方法
請參見:
http://www.pconline.com.cn/pcedu/soft/gj/photo/10205/62741.html
http://www.enet.com.cn/eschool/inforcenter/A20040412301679_2.html
如何將PDF檔案轉為文本?
此問題需分為兩部分來解決:
一、如果PDF文檔本身由WORD轉成:
網上巳有很多這方面的論述,請參閱:
http://www.knowsky.com/4419.html
也可用其它PDF轉Word工具,如:“PDF轉Word工具”
http://www.cqforest.com/soft/12136.htm
二、如果PDF文檔本身由掃描檔案轉成,用上面的方法就無效了。那就需要分幾步來完成:
1,先將PDF轉為圖片:
可用:“Galcott PDF Converter”軟體將PDF轉為圖片格式
http://www.jfdown.com/SoftView/SoftView_17738.html
2,再用OCR軟體識別、校對:
推薦使用“漢王OCR2.5”
ftp://software@211.147.168.80/pic/hwdoc.rar
雖然漢王巳出了5300、5800、6800,但真正完全破解的只有漢王OCR2.5,用它的批檔案處理模式可進行自動識別,然後再校對。
3,輸出到文本:
完成識別校對後,可用我先前發的“OCR助手”軟體
http://www.czzyy.com/personal/wyx/download/OCRPlus.exe
刪除多餘的分行符號併合並匯出為單個文字檔。
4,在WORD中作最後的修飾。
如何將PDG(超星格式)檔案轉為文本?
最簡單的辦法就是用超星內建的OCR進行文字識別了,不過效果和效率嘛.........
推薦的方法:
總的原理就是先把PDG轉為圖片,再用專業軟體識別、校對,最後輸出為文本。
1,將PDG轉為圖片
首先安裝抓圖軟體“SnagIt”
http://www.xyzdown.com/soft/2617.htm
讓你安裝此軟體,不是要你用它來抓超星的圖的~~~,我們需要的是它的“虛擬列印”功能(安裝時一定要選中安裝虛擬列印)。
使用方法:在“超星”中開啟需要進行格式轉換的書,然後“列印”,在彈出的視窗中選擇印表機時,選擇“SnagIt”即可,並設定輸出圖片為“黑白”(如為“彩色”,那輸出的檔案大的可怕。),等列印結束後自動彈出SnagIt程式主介面,儲存即可。
2,文字識別和校對
3,...........
4.............
請參閱上面的說明。
通過學習如何將PDF或PDG檔案轉換為文字檔,我們可以發現,關鍵是如何將源檔案轉換為圖象格式,然後再進行文字識別,本人推薦使用SnagIt和漢王OCR,通用、快捷、方便。
如果以後遇到中國期刊網的CAJ檔案、國圖的NLC檔案......等等等等,就不用我再.......
其它說明:
如果是要OCR PDF檔案,似乎檔案的大小不應成為障礙,因為我們會將PDF檔案的每一頁輸出為一個圖象檔案(只要你的磁碟空間允許即可)。
如果一本書就是一個PDF檔案,那操作起來會方便得多;反之,如果一本書由多個PDF檔案組成,就需要進行重複的操作了。
如果你只是想要OCR其中的一部分內容,可用“列印”的方法(請參閱 http://www.cntcm.org/cgi-bin/topic.cgi?forum=6&topic=289&show=0 ),並在列印時選擇相應的頁碼即可以了。
如果你要分割或合并PDF檔案,可以用PDF Split-Merge 軟體,:
http://count.skycn.com/s0ftdownlOad.php?url=http://xj-http.skycn.net:8080/down/HB-PDFSM11-fxj.ZIP
另外:PDF Converter 1.4的Serial: 3861794
Office2003實現PDF檔案轉Word文檔
經過本人嘗試,發現可以利用Office 2003中的Microsoft Office Document Imaging組件來實現PDF轉WORD文檔,也就是說利用WORD來完成該任務。方法如下:
用Adobe Reader開啟想轉換的PDF檔案,接下來選擇“檔案→列印”菜單,在開啟的“列印”視窗中將“印表機”欄中的名稱設定為“Microsoft Office Document Image Writer”,確認後將該PDF檔案輸出為MDI格式的虛擬列印檔案。
注:如果沒有找到“Microsoft Office Document Image Writer”項,使用Office 2003安裝光碟片中的“添加/刪除群組件”更新安裝該組件,選中“Office 工具 Microsoft DRAW轉換器”。
然後,運行“Microsoft Office Document Imaging”,並利用它來開啟剛才儲存的MDI檔案,選擇“工具→將文本發送到Word”菜單,在彈出的視窗中選中“在輸出時保持圖片版式不變”,確認後系統會提示“必須在執行此操作前重新運行OCR。這可能需要一些時間”,不管它,確認即可。
注:對PDF轉DOC的識別率不是特別完美,轉換後會丟失原來的排版格式,所以轉換後還需要手工對其進行排版和校對工作。
以上僅在word2003中可用,其他版本沒有Microsoft Office Document Image Writer。