標籤:搜尋引擎 lucene 網路爬蟲
0搜尋引擎文本分析 ——網路爬蟲處理互連網資訊,從數量上看比例較大的是靜態網頁和動態HTML頁面。但整個網路上散落的各種格式化文字檔也非常重要。這部門檔案包括了各種文章、各種產品文檔等,對使用者有很大的協助。
1——非結構化文本概述
互連網上和企業網內有很多專業的文檔資料,尤其在檢索一些專業資料時,往往會在出現網頁文檔的同時出現一些DOC PDF PPT等格式的文檔。非結構化的文本通常具有一定得格式,格式化的檔案一般結構複雜,通常有多家廠商的不同系統產生,這些格式使得普通程式讀取內容無從下手(如htmlParser)
2 ——HTML文件剖析:
HTML網頁需要分析處理後才能用於索引和檢索的,HTML網頁的分析處理工具主要完成網頁格式文檔的解析,過濾網頁中顯示格式控制元素和無意義資訊。 —— HTMLParser工具包
3——PDF 文件剖析:
它是國內使用率非常高的一種文檔格式,這種檔案格式把文字映像等多種資訊集合在一個文檔中,必鬚根據他的文檔格式,提取基本的文本資訊,才能用於檢索。—— PDFBox工具包是一款免費的開源軟體 http://pdfbox.apache.org/download.cgi
4——Office 文件剖析:
它是目前最流行的文檔格式,幾乎成為事實的文檔標準,互連網上散落著大量的這樣文檔,幾乎所有的搜尋引擎都提供了這種格式文檔的檢索。但是,微軟的檔案格式不公開,並且不斷的變化 —— POI工具包是Apache Jakarta 的一個項目。http://poi.apache.org/download.html
Microsoft 的Office格式非常複雜,往往包含了各種文件屬性資訊、文檔內的格式資訊,有時候甚至包含了複合文檔。文件屬性資訊主要包括文檔的標題、主題、摘要、類別、關鍵詞等;文檔內部的格式資訊包括了文檔的字型、字型大小、表格、表徵圖,其他OLE2的本文元素等。POI 提供了訪問Office的API(HSSF HWPF HSLF)分別處理excel word powerpoint
5——XML 文件剖析:
是一種較為 通用的文檔格式,XML是可延伸標記語言 (XML)(eXtensible Mark隨身碟Language),是一種簡單的資料存放區語言,使用系列簡單的標記描述資料,廣泛用於資料交換領域 —— JDOM工具包,功能強大,使用靈活方便,可以非常方便的完成XML的解釋和讀取操作,能夠協助開發人員快速實現XML應用程式。http://jdom.org/downloads/index.html
Nutch & Lucene 之 搜尋引擎文本分析