標籤:文本抽取 只能搜尋引擎 情報分析服務 提高資訊資源加工效率
DMCTextFilter V4.2是由北京紅櫻楓軟體有限公司研製和開發的純文字抽出通用程式庫產品。本產品可以從各種各樣的文檔格式的資料中或從插入的OLE對象中,完全除掉特殊控制資訊,快速抽出純文字資料資訊。便於使用者實現對多種文檔資料資源資訊進行統一管理,編輯,檢索和瀏覽。本產品採用了先進的多語言、多平台、多線程的設計理念,支援多國語言(英語,中文簡體,中文繁體,日本語,韓國語),多種作業系統(Windows,Solaris,Linux,IBM AIX,Macintosh,HP-UNIX),多種文字集合代碼(GBK,GB18030,Big5,ISO-8859-1,KS X 1001,Shift_JIS,WINDOWS31J,EUC-JP,ISO-10646-UCS-2,ISO-10646-UCS-4,UTF-16,UTF-8等)。提供了多種形式的API功能介面(檔案格式識別函數,文本抽出函數,檔案屬性抽出函數,頁抽出函數,設定User Password的PDF檔案的文本抽出函數等),便於使用者方便使用。使用者可以十分便利的將本產品組裝到自己的應用程式中,進行二次開發。通過調用本產品的提供的API功能介面,實現從多種文檔格式的資料中快速抽出純文字資料。本產品在國內外得到了廣泛的應用,在產品效能和品質上都得到了使用者高度的好評。
產品功能:
1. 檔案格式自動識別功能
本產品通過解析檔案內部的資訊,自動識別組建檔案的應用程式名稱和其版本號碼,不依賴於檔案的副檔名,能夠正確識別檔案格式和相應的版本資訊。可以識別的檔案格式如下:支援Microsoft Office、RTF、PDF、Visio、OutlookEML和MSG、Lotus1-2-3、HTML、AutoCAD DXF和DWG、IGES、PageMaker、ClarisWorks、AppleWorks、XML、WordPerfect、Mac Write、Works、CorelPresentations、QuarkXpress、DocuWorks、WPS、壓縮檔的LZH/ZIP/RAR以及一太郎、OASYS等檔案格式
2. 文本抽出功能
即使系統中沒有安裝作成檔案的應用程式,可以從指定的檔案或插入到檔案中的OLE中抽出文本資料。
3. 檔案屬性抽出功能
從指定的檔案中,抽出檔案屬性資訊。
4. 頁抽出功能
從檔案中,抽出指定頁中文本資料。
5. 對加密的PDF檔案文本抽出功能
從設有開啟文檔口令密碼的PDF檔案中抽出文本資料。
6. 流(Stream)抽出功能
從指定的檔案、或是嵌入到檔案中的OLE對象中向流裡抽取文本資料。
7. 支援的語言種類
本產品支援以下語言:英語,中文簡體,中文繁體,日本語,韓國語
8. 支援的字元集合的種類
抽出文本時,可以指定以下的字元集合作為文字檔的字元集(也可指定任意特殊字元集,但需要另行定製開發):GBK,GB18030,Big5,ISO-8859-1,KS X1001,Shift_JIS,WINDOWS31J,EUC-JP,ISO-10646-UCS-2,ISO-10646-UCS-4,UTF-16,UTF-8等
目前,DMCTextFilter V4.2 純文字抽出通用程式庫產品在數字圖書館,搜尋引擎,全文檢索索引,資料庫等各個領域得到了廣泛應用。在世界各地得到了眾多知名企業的青睞。本產品在效能和品質上都得到了使用者高度評價。我司將不懈努力,繼續為使用者提供品質優良,效能可靠的一流產品。為使用者提供優良的技術服務,滿足使用者的各種需求。
在實際的推廣和應用中,我公司的通用文本抽出程式軟體被應用到了多個領域,如:資訊資源開發利用,智能搜尋引擎,情報分析和服務,資訊安全,企業知識門戶,數字圖書館,電子商務等領域。
目前主要突出體現出如下應用價值:
1)為海量非結構化資源提供了智能加工工具,提高資訊資源加工效率;同時,可為政務資訊資源服務的使用者提供智能檢索和挖掘分析的手段,放大政務資訊資源增值效用。
2)此軟體在國家相關部門的搜尋引擎以及多個行業垂直搜尋引擎服務的建設中,獲得了成功應用,可以為提高垂直搜尋引擎服務的智能化、行業化和知識化水平奠定了基礎。
3)此軟體為相關機構從事Alibaba Content Security Service管理提供了智能化的技術,可以降低監管成本,提高監管效率。
此軟體可以作為資訊資源利用和知識管理應用的基礎構件,為公司資訊資源的加工、分析和服務提供先進智能的文本轉換技術。
本文出自 “hyfsoft” 部落格,請務必保留此出處http://hyfsoft.blog.51cto.com/8878038/1529797