Nutch & Lucene 之 搜尋引擎文本分析

來源:互聯網
上載者:User

標籤:搜尋引擎   lucene   網路爬蟲   


0搜尋引擎文本分析 ——網路爬蟲處理互連網資訊,從數量上看比例較大的是靜態網頁和動態HTML頁面。但整個網路上散落的各種格式化文字檔也非常重要。這部門檔案包括了各種文章、各種產品文檔等,對使用者有很大的協助。

1——非結構化文本概述

互連網上和企業網內有很多專業的文檔資料,尤其在檢索一些專業資料時,往往會在出現網頁文檔的同時出現一些DOC PDF PPT等格式的文檔。非結構化的文本通常具有一定得格式,格式化的檔案一般結構複雜,通常有多家廠商的不同系統產生,這些格式使得普通程式讀取內容無從下手(如htmlParser)

2 ——HTML文件剖析:

HTML網頁需要分析處理後才能用於索引和檢索的,HTML網頁的分析處理工具主要完成網頁格式文檔的解析,過濾網頁中顯示格式控制元素和無意義資訊。 —— HTMLParser工具包

3——PDF 文件剖析:

它是國內使用率非常高的一種文檔格式,這種檔案格式把文字映像等多種資訊集合在一個文檔中,必鬚根據他的文檔格式,提取基本的文本資訊,才能用於檢索。—— PDFBox工具包是一款免費的開源軟體 http://pdfbox.apache.org/download.cgi

4——Office 文件剖析:

它是目前最流行的文檔格式,幾乎成為事實的文檔標準,互連網上散落著大量的這樣文檔,幾乎所有的搜尋引擎都提供了這種格式文檔的檢索。但是,微軟的檔案格式不公開,並且不斷的變化 —— POI工具包是Apache Jakarta 的一個項目。http://poi.apache.org/download.html

Microsoft 的Office格式非常複雜,往往包含了各種文件屬性資訊、文檔內的格式資訊,有時候甚至包含了複合文檔。文件屬性資訊主要包括文檔的標題、主題、摘要、類別、關鍵詞等;文檔內部的格式資訊包括了文檔的字型、字型大小、表格、表徵圖,其他OLE2的本文元素等。POI 提供了訪問Office的API(HSSF HWPF HSLF)分別處理excel word powerpoint

5——XML 文件剖析:

是一種較為 通用的文檔格式,XML是可延伸標記語言 (XML)(eXtensible Mark隨身碟Language),是一種簡單的資料存放區語言,使用系列簡單的標記描述資料,廣泛用於資料交換領域 —— JDOM工具包,功能強大,使用靈活方便,可以非常方便的完成XML的解釋和讀取操作,能夠協助開發人員快速實現XML應用程式。http://jdom.org/downloads/index.html


Nutch & Lucene 之 搜尋引擎文本分析

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.