目 錄
第一章 引言……………………………………………………………………………….1
1.1 背景... 1
1.2 本文安排... 2
第二章 Web資訊採集概述………………………………………………………………4
2.1 Web資訊採集系統的基本原理... 4
2.2 Web資訊採集系統的基本結構... 4
2.3 Web資訊採集面臨的主要困難和相應的技術手段: 6
2.4 採集系統執行個體... 8
第三章 Web資訊採集的研究現狀………………………………………………….. ...11
3.1 基於整個Web的資訊採集... 11
3.2 增量式Web資訊採集: 12
3.3 基於主題的Web資訊採集: 12
3.4 基於使用者個人化的Web資訊採集... 13
3.5 基於Agent的資訊採集... 14
3.6 遷移的資訊採集... 15
3.7 基於元搜尋的資訊採集: 15
3.8 小結... 15
第四章 基於主題的Web 資訊採集基本問題研究………………………………… ...17
4.1 基於主題的Web資訊採集的定義... 17
4.2 基於主題的Web資訊採集的優點... 17
4.3 基於主題的Web資訊採集的分類... 18
4.4 主題頁面在Web上的分布特徵... 19
4.5 相關性判別演算法研究... 21
第五章 基於主題的Web 資訊採集系統模型及我們的對策……………………… ...37
5.1 系統模型... 37
5.2 模型中的關鍵問題及我們的策略... 37
第六章 主題選擇………………………………………………………………………...41
6.1 主題的定義... 41
6.2 主題分類目錄... 41
6.3 Web上的主題分類目錄的特點... 42
6.4 主題選擇策略... 42
第七章 Spider採集……………………………………………………………………44
7.1 Spider的系統模型... 44
7.2 採集演算法及實現... 45
第八章 頁面分析……………………………………………………………………...…49
8.1 HTML文法分析... 49
8.2 頁面中本文的提取... 49
8.3 頁面中連結的提取... 50
8.4 頁面中標題的提取... 51
第九章 URL、頁面與主題的相關性判定…………………………………………...…52
91 URL與主題的相關性判定——IPageRank演算法... 53
9.2 頁面與主題的相關性判定——向量空間模型演算法... 56
第十章 系統的實現與總結…………………………………………………………...…58
10.1 系統實現情況... 58
10.2 系統測試結果... 58
103 進一步的工作... 62
10.4 結論... 62
參考文獻 …………………………………………………………………………………...64
致 謝 …………………………………………………………………………………...68
作者簡介……………………………………………………………………………………69
第一章 引言1.1 背景
隨著Internet/Intranet的迅速發展,網路正深刻地改變著我們的生活。而在網上發展最為迅猛的WWW(World Wide Web)技術,以其直觀、方便的使用方式和豐富的表達能力,已逐漸成為Internet上最重要的資訊發布和傳輸方式。隨著資訊時代的到來和發展,Web上的資訊如雨後春筍般迅速增長起來。截止到2000年7月,Internet上的網頁數量就已經超過21億,上網使用者超過3億,而且網頁還在以每天700萬的速度增加[徐澤平 2001]。這給人們的生活提供了豐富的資源。
然而,Web資訊的急速膨脹,在給人們提供豐富資訊的同時,又使人們在對它們的有效使用方面面臨一個巨大的挑戰。一方面網上的資訊多種多樣、豐富多彩,而另一方面使用者卻找不到他們所需要的資訊。因而基於WWW的網上資訊的採集、發布和相關的資訊處理日益成為人們關注的焦點。
為此,人們發展了以Web搜尋引擎為主的檢索服務。為瞭解決網上資訊檢索的難題,人們在資訊檢索領域進行了大量的研究,開發了各種搜尋引擎(如Google、Yahoo)。這些搜尋引擎通常使用一個或多個採集器從Internet上收集各種資料(如WWW、FTP、Email、News),然後在本機伺服器上為這些資料建立索引,當使用者檢索時根據使用者提交的檢索條件從索引庫中迅速尋找到所需的資訊[Bowman 1994]。作為這些搜尋引擎的基礎和組成部分,Web資訊採集正發揮著舉足輕重的作用,並且隨著應用的深化和技術的發展,它也越來越多的應用於網站結構分析、頁面有效性分析、Web圖進化、Alibaba Content Security Service檢測、使用者興趣挖掘以及個人化資訊擷取等多種服務和研究中。簡單說,Web資訊採集是指通過Web頁面之間的連結關係,從Web上自動地擷取頁面資訊,並且隨著連結不斷向所需要的Web頁面擴充的過程。
傳統的Web資訊採集的目標就是儘可能多地採集資訊頁面,甚至是整個Web上的資源,而在這一過程中它並不太在意採集的順序和被採集頁面的相關主題。這樣做的一個極大好處是能夠集中精力在採集的速度和數量上,並且實現起來也相對簡單,例如Google採集系統在並行4個採集器時的速度可以達到每秒100頁,從而它配合搜尋引擎給網路使用者帶來了很大的便利。但是,這種傳統的採集方法也存在著很多缺陷。
隨著WWW資訊的爆炸性增長,資訊採集的速度越來越不能滿足實際應用的需要。最近的實驗表明,即使大型的資訊採集系統,它對Web的覆蓋率也只有30-40%。解決這一問題的直接辦法是升級資訊採集器的硬體,採用處理能力更強的電腦系統,然而這種方法的擴充性有限,性價比也不高。一個更好的解決方案是採用分布式方法來提高並行能力,但是並行不但增加了系統的開銷和設計的複雜性,並且並行換來的效益也隨著並行採集器數目的增加而顯著地減小。目前,一般的大型採集系統都採用了並行機制,但並行帶來的改善效果仍遠不能滿足人們的需要。人們需要從其它角度改善目前的困境。比如說對整個Web分塊採集,並將不同塊的採集結果整合到一起,以提高整個Web的採集覆蓋率。
Internet資訊的分散儲存、管理和動態變化也是困擾著資訊採集的問題之一。由於資訊源隨時可能處於變化之中,資訊採集器必須時常地重新整理資料,但仍無法避免採集到的頁面失效的情況。對於傳統的資訊採集來說,待重新整理頁面數量的巨大使得很多採集系統重新整理一遍需要數周到一個月的時間[Aggarwal et al. 2001][Brin&Page 1998],這使得頁面的失效率非常地巨大。Selberg和Etzioni在1995年的調查發現,通過Internet中最常用的一些搜尋引擎查詢到的結果URL中,14.9%的目標頁面已經失效了[Selberg&Etzioni 1995]。一個顯然的緩解辦法就是減小採集頁面的數量,從而減小重新整理一遍的時間,進而減小頁面已採集頁面的失效率。
傳統的基於整個Web的資訊採集需要採集的頁面數量十分浩大,這需要消耗非常大的系統資源和網路資源,而對這些資源的消耗並沒有換來採集到頁面的較高利用率,事實上,它們中有相當大的一部分利用率很低。這是因為,使用者往往只關心其中極少量的頁面,並且這些頁面往往集中在一個主題或幾個主題內,而採集器採集的大部分頁面對於他們來說是沒有用的。儘管許多使用者合起來的效果提高了整個採集到頁面的利用率,但仍然顯得利用率偏低,這顯然是對系統資源和網路資源的一個巨大浪費。為了有效提高它們的利用效率,我們有必要另闢蹊徑。
對於使用者的一般資訊查詢檢索要求,傳統資訊採集器所組成的搜尋引擎能夠提供較好的服務,但對於使用者更多的具體要求,這種傳統的基於整個Web的資訊採集所提供的服務就難以令人滿意。對於每個使用者來說,儘管他們輸入同一個查詢詞,但他們渴望得到的查詢結果卻是不一樣的,而傳統的資訊採集和搜尋引擎卻只能死板地返回相同的結果,這是不合理的,需要進一步提高。
這些問題主要都源於兩點:採集頁面的數量過於龐大和採集頁面內容的過於雜亂。對整個 Web頁面進行分類,按類別採集,基於主題進行採集的思想應運而生。它有效減少了採集頁面的數量,增加了採集頁面的規整程度,進而有效緩解了上述問題。因此需要開展對基於主題的Web資訊採集研究。
1.2 本文安排
第二章概述了Web資訊採集的基本結構、所面臨的主要困難和相應的技術手段。在第三章裡,討論了Web資訊採集的研究現狀和熱門的發展方向,並通過論述指出基於主題的Web資訊採集的迫切性和必要性。在第四章裡,我們討論了基於主題的Web資訊採集的基本問題,重點是對主題頁面在Web 上的分布和相關性判定演算法的研究。第五章給出了我們設計的基於主題的Web資訊採集系統的結構模型,並就搭建一個這種採集系統所面臨的關鍵問題和相應對策做了簡單的描述。在接下來的四章中(從第六章到第九章),我們按照結構模型中的主要部分主題選擇、Spider採集、頁面分析、URL和頁面與主題的相關性判定分別作了較為詳細的論述,並給出了我們的設計方案和演算法。最後,在第十章裡,我們給出了系統的實驗結果和進一步需要研究的問題。