標籤:
原文連結 http://www.cnblogs.com/surgewong/p/3351863.html
倒排索引(Inverted index),顧名思義,是一種反向的索引。
首先我們先來看一下索引的概念,索引好比書的目錄,通過目錄可以快速找到想要的章節。
而倒排索引就相當於知道章節的內容,就可以找到目錄的資訊。
可能這樣子類比還不是很清楚,那麼我們就舉一個簡單的例子來說明一下。
假設我們有三句話:
T[0] = "it is what it is"
T[1] = "what is it"
T[2] = "it is a banana"
在這裡,我們的索引是建立在位置(position)和單詞(word)之間建立。
常規索引是指通過位置找到相應的單詞,比如:T[0]的第一個單詞是it,可以記為 (0,0) : "it",再如 (2,1) : "is"。
倒排索引則是反過來,通過單詞擷取位置,比如:"it" 這個單詞出現的位置有 (0,0) (0,3) (1,2) (2,0),
這樣可以記為 "it" :{(0,0) (0,3) (1,2) (2,0)}。
通過對上述三句話建立倒排索引可以得到:
"a" : {(2,2)}
"banana" : {(2,3)}
"is" : {(0,1) (0,4) (1,1) (2,1)}
"it" : {(0,0) (0,3) (1,2) (2,0)}。
"what" : {(0,2) (1,0)}
通過構建好的倒排索引,使得我們可以很方便的實現對語句的檢索,
比如: 需要檢索包含"what" "is" "it"三個單詞的語句,忽略倒排表中的第二位(單詞在每句中的位置),
可以得到 {0 1}∩{ 0 1 2}∩{0 1 2} = {0 1},因此我們斷定T[0]和T[1]滿足條件。
在檢索 "what is it"這個片語的時候還需要考慮到單詞的具體位置,
因此我們只能夠擷取到 T[1] 滿足條件{(1,0) (1,1) (1,2)}。
總結,上面的分析可以告訴我們,單詞或語句的檢索在構建好倒排索引之後可以轉化成一個集合求解的問題,
而不用逐行逐字的掃描,這使得檢索效率得到大大地提高,這也就是為什麼倒排索引在搜尋領域如此重要的原因。
同樣有個問題擺在面前,建立倒排索引是非常耗時的。所幸的是這個過程可以離線完成。
更多的資料資訊請參考百度維基百科,百度百科,以及相關論文等等
【轉】倒排索引