使用字典樹1
author: luison9999
原文連結
簡介
有許多演算法和資料結構可以用來在一個文本中索引和尋找一個字串,有的已經包含在了標準庫中,但不是所有的;字典樹這個資料結構就是一個很好的例子。
讓一個單詞作為一個單獨的字串字典就是一個很大的單詞集合。如果我們有一個字典,我們需要知道一個單詞是否在這個字典中,那麼字典樹就可以協助我們。但是你可能會問自己,“為什麼不用set<sting>和hash table呢?”有兩個主要的原因:
- 字典樹可以在O(L)的時間內(L是一個單詞的長度)插入和尋找一個單詞。這比set要快很多,但可能只比hash table稍快一點。
- set<string>和hash table只能在字典中尋找完全符合的單詞;字典樹可以允許我們尋找有一個字元不同,首碼相同,一個字元丟失等等的單詞。
字典樹不僅在TopCoder的問題中會很有用,而且在軟體工程中很多應用程式也廣泛使用。假設一個網頁瀏覽器。你知道瀏覽器怎麼自動的補全你的文筆或者顯示所有可能的寫法?是的有了字典樹我們可以很快的做到這個。你知道一個拼字校正器怎麼檢查你輸入的單詞是否在字典中的嗎?也是字典樹。你也可以使用字典樹來提供不在字典中的單詞的建議。
什麼是一棵樹?
你會看到字典樹是多麼的美妙,但是你也可能不知道它是什麼和它的名字是怎麼來的。Trie這個單詞是retrieval的中綴,因為字典樹可以用單詞的首碼在字典中尋找一個單詞。字典樹結構的主要是下邊幾個:
- 字典樹是一棵每個節點代表一個單詞或者一個首碼。
- 樹的根節點代表一個空的字串(””),與根直接相連的兒子代表首碼是1的,離根2條邊的距離的代表長度為2的首碼,以此類推。在其他的單詞中,一個點離根有k條邊的是首碼為k的。
- 假設V和W是字典樹的兩個節點,V是W的父節點,那麼V一定有W的首碼。
下邊的圖片顯示了一個字典樹有“tree”,“trie”,“algo”,“assoc”,“all”和“also”。
注意樹的每個節點不存整個首碼或者整個單詞。這個想法是程式要記住每個節點代表的單詞而在樹底。