基於主題的Web資訊採集技術研究(五)

來源:互聯網
上載者:User
第五章         基於主題的Web 資訊採集系統模型及我們的對策

5.1 系統模型

基於主題的Web資訊採集技術在應用需求的推動下,已經成為一個熱門的研究課題,為了更好的研究這個課題,我們設計了一個基於主題的Web 資訊採集系統模型,5.1所示。為實現對基於主題的資訊自動採集,我們將整個處理過程分成五大模組:主題選擇和初始URL選擇、Spider採集、頁面分析、URL與主題的性關性判定(連結過濾/連結預測)、頁面與主題的性關性判定(頁面過濾)。下邊簡要地說明整個系統模型中的關鍵問題,在後續幾章裡,我們將詳細討論各個模組的演算法及實現。

5.2 模型中的關鍵問題及我們的策略5.2.1主題的選擇

為了有效進行剪枝和採集,基於主題的Web 資訊採集所要解決的一個重要問題就是主題選擇問題。針對隨便的主題詞可能較大地影響採集效果,系統一般提供給使用者一個主題分類目錄以供選擇。為了有效地確定使用者選定主題的含義,使用者要提供對主題的進一步描述,比如提供若干表達主題含義的文本,當然系統也會提供一些主題文本供使用者選擇。我們的系統就是按照中國圖書館的分類方法的第一級目錄和二級目錄對主題進行分類的,並在每個主題下配備了一些主題文本,以供使用者選擇。

5.2.2 採集起點的選擇

一般採集器是從一個種子URL集出發,通過Web協議向Web上所需的頁面擴充的。基於主題的Web資訊採集也不例外,也有一個起始採集的種子URL集。但是,基於主題的Web資訊採集的採集起點選擇卻必須十分謹慎,因為這將影響著採集的效率,尤其是剛開始採集的準確率。

基於Web上的Linkage/Sibling Locality特性,一般採集系統需要選擇品質較高的主題URL作為初始種子URL集。為此,我們採用我們自己設計的小金手元搜尋引擎為每個主題搜尋網頁面,搜尋排名前50的URL作為每個主題目錄下的種子URL。使用者在設定主題採集時可以在這50個URL中進行選擇,也可以將自己知道的好的主題URL輸入進來,以提高採集的效果。

而更進階的初始URL的選擇方法是根據使用者興趣制導的,這需要有一個初始的使用者興趣檔案,這個檔案可以由使用者填寫的興趣和使用者瀏覽器中的書籤&收藏檔案產生。這部分的研究也屬於基於使用者興趣的採集。

 

 

                            圖5.1 系統模型

5.2.3 Spider採集

這個部分處於系統的底層,也叫“網路蜘蛛”,是系統專門與具體的Web打交道的部分。主要通過各種Web協議來自動採集Internet上WWW網站內有效資訊(包括文本、超連結文本、圖象、聲音、影像、壓縮包等各類文檔)。這些Web協議包括HTTP、FTP以及BBS,還根據使用者的需要採集了Web Chat、ICQ等特殊資訊。這個部分主要對應於在第二章中介紹的Web資訊採集系統的基本結構中的“協議處理器”部分。

5.2.4頁面分析

在頁面採集到以後,我們要從中提取出連結來,然後根據連結與主題的相關性判定來過濾與主題無關的連結,接受與主題相關的連結並進行下一步的採集;為了有效進行連結與主題的相關性判定,我們也要分析出頁面連結中的擴充中繼資料(這個概念我們將在以後的章節中具體介紹)來;再者,為了進行頁面與主題的相似性判定,我們也必須提取出頁面中的本文和關鍵詞來;為了其它操作的處理,我們也要進行對頁面內容標題、摘要等的提取。所有的這些就是頁面分析的內容:連結的提取、中繼資料的提取、本文的提取、關鍵詞的提取、標題的提取、摘要的提取。它們的詳細提取演算法我們將在後文的相應章節中介紹。

5.2.5 URL與主題的相關性判定(連結過濾/連結預測))

為了有效提高基於主題的Web資訊採集的準確率和效率,系統需要對“待採集URL”進行URL與主題的相關性判定,也可以叫做連結過濾或連結預測。按照高預測值優先採集、低預測值(小於設定閾值)被拋棄的原則進行剪枝處理。這樣可以大大減少採集頁面的數量,有效提高主題資訊搜尋的速度和效率。這個問題是本類採集系統的重要問題,也是本文論述的一個重點,我們將在下面相應的章節中通過大量的演算法分析詳細剖析這個問題。

5.2.6 頁面與主題的相關性判定(頁面過濾)

為了進一步提高採集頁面的準確率,需要對已採集的頁面進行主題相關性評價,也就是頁面過濾。通過對評價結果較低的頁面(小於設定的閾值)剔除,來提高所採集主題頁面的準確率。這個問題是檢索領域內的一個經典問題,已經有許多成熟的基於關鍵詞的相關性判定演算法。我們採取的方法就是基於關鍵詞的向量空間模型演算法。

5.2.7 資料存放區

主要有三種資料庫需要儲存,它們是主題頁面庫、全域URL隊列和中間資訊記錄庫。主題頁面庫主要存放採集器採集過的並經過頁面過濾處理後的主題頁面。全域URL隊列則是存放從採集到的頁面中提取出來的URL的地方,這些URL在進入URL隊列前必須經過URL預測處理,只有被預測為指向主題相關頁面的連結才能進入全域URL隊列。在插入隊列時,也要根據URL與主題的預測相關性的大小排序,相關性越高,排序越前。為了有效進行URL與主題的性關性判定和頁面與主題的相關性判定流程,顯然需要許多中間處理結果,比如使用IPageRank演算法時每個頁面所擁有的IPageRank值,所有的這些中間資料,儲存在中間資訊記錄庫中。

 

                                                                                                                                                 第六章         主題選擇

在我們講基於主題的採集的時候,並沒有完全弄清楚一個問題——什麼是主題。針對可變主題的資訊採集系統,就像使用者利用搜尋引擎為自己服務時必須正確地選取查詢詞一樣,我們必須有效進行主題選擇,這樣才能採集到我們真正需要的主題頁面。本章在對主題和主題分類目錄作了詳細的說明後,給出了我們的主題選擇策略。

6.1 主題的定義

一個主題就是一個“含義”,或者叫一個“概念”。它可以是一個詞,也可以是一個短語,甚至是一個段落,一篇文章。這個“概念”的範圍可大可小,大的時候可以非常廣泛,但此時它的意義也非常模糊;小的時候它可以非常狹義,而這時它的意義卻非常具體。因此,基於主題的採集系統採集的頁面數量根據主題概念的大小有很大的變化。

6.2 主題分類目錄

 

圖6.1 中國圖書館分類法

一般的搜尋引擎返回給使用者的結果不令使用者滿意的一個重要原因是系統獲得查詢關鍵詞並不足以反映使用者的需求,這很大程度上是因為關鍵詞選擇得不合適。基於主題的資訊採集也面臨著主題選擇的困難。現實中的主題範圍太廣泛,雜亂無章,混亂無序,有些主題沒有實際用途上的意義(比如,“如果,和”);而有些主題又幾乎不能引起人們的採集興趣(比如,“跑”)。為此,有必要對主題進行統一的分類。這不光有利於固定主題的資訊採集系統選擇合適的主題範圍和主題角度進行採集,而且還為多個此類採集系統聯合採集更大範圍的主題頁面提供了有效依據,還可以將主題分類推薦給可變主題採集系統前的使用者,使他們的選擇更加明智。

目前,很多基於主題的採集採用yahoo主題分類目錄,當然也可以是其它分類目錄,但所選擇的分類目錄應該分類比較合理,並具有一定的權威性。圖6.1給出了中國圖書館分類法的第一級目錄對整個主題進行的分類。

當然,這些基於主題的資訊採集系統,在提供給使用者主題分類目錄的同時,仍然允許使用者自由輸入主題,以提高系統的靈活性。

6.3 Web上的主題分類目錄的特點

Web上有許多分類目錄(Directory)網站,如Yahoo!,Yellow Pages。一般有以下特點:

l    基本是樹形結構。每個節點(分葉節點除外)有數量不等的若干子節點。少數節點有不只一個父節點,因此不構成嚴格的樹結構。節點依據知識本體論(Knowledge Ontology)劃分。分類目錄網站的首頁一般只顯示一、二級節點。

l    節點命名。每個節點有一個簡短的命名。非根節點的全名是從根到該節點的路徑上的所有節點的名稱的順序組合,如Business_and_Economy/Companies/Travel/ Agents。

l    節點內容。每個節點收集有若干URL,除了分葉節點之外,每個節點有若干子節點。

l    維護。分類目錄的維護一般是人工進行的,由分類目錄網站僱傭專人分別負責各個子類,不斷跟蹤Web上的資訊,這是大多數網站的主流做法。另一類做法是由志願人員維護,個別網站可以有使用者自己定製子樹。

Web上主題分類目錄的這些特點決定了系統提供給使用者的是一個可層層深入的樹狀主題結構圖。

6.4 主題選擇策略

在本節裡我們討論的主題選擇主要是針對可變主題的資訊採集系統。從前文我們已經知道,一個主題可以是一個詞語,一個句子,甚至一個段落。為了讓使用者能夠有效表達主題採集要求,採集系統一般要提供給使用者一個主題分類目錄,使用者可以通過它選擇一個最適合的主題進行採集,這個主題可以是樹根、樹枝,也可以是樹葉。

為了增加相似性判定時候的有效性,系統還必須為每個主題提供一定數量的最能表達主題概念的樣本文本,通過提取這些文本的特徵,系統定量的掌握主題的含義。同時,為了體現對使用者的針對性,系統允許使用者對樣本檔案進行選擇。

為此,使用者可以在三個方面進行採集主題的選擇:首先,使用者在主體分類目錄中尋找自己所要表達的主題;其次,對系統提供的樣本檔案進行選擇,以使得它們能夠完整的準確的表達自己的主題需求;第三,如果系統提供的主題選擇文本不能全面完整的刻畫自己的主題需求,或者主題分類目錄中根本沒有自己所需要的主題,則使用者必須自己輸入主題詞和主題樣本檔案。這是和一般搜尋引擎的關鍵詞輸入不同的。和關鍵詞相比,主題詞用更加定量的方法來描述,一般刻畫的意義更準確、更全面,刻畫手段更靈活、更方便。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.