資訊檢索和網路資料採礦領域論文技術基礎

來源:互聯網
上載者:User

資訊檢索和網路資料領域(WWW, SIGIR, CIKM, WSDM, ACL, EMNLP等)的論文中常用的模型和技術總結
引子:對於這個領域的博士生來說,看懂論文是入行瞭解大家在做什麼的研究基礎,通常我們會去看一本書。看一本書固然是好,但是有一個很大的缺點:一本書本身自成體系,所以包含太多東西,很多內容看了,但是實際上卻用不到。這雖然不能說是一種浪費,但是卻沒有把有限力氣花在刀口上。
我所處的領域是關於網路資料的處理(國際會議WWW, SIGIR, CIKM, WSDM, ACL, EMNLP,等)
我列了一個我自己認為的在我們這個領域常常遇到的模型或者技術的列表,希望對大家節省時間有所協助:

1. 機率論初步

主要常用到如下概念:初等機率定義的三個條件,全機率公式,貝葉斯公式,鏈式法則,常用機率分布(Dirichlet 分布,高斯分布,多項式分布,玻松分布m)
雖然機率論的內容很多,但是在實際中用到的其實主要就是上述的幾個概念。基於測度論的高等機率論,幾大會議(www,sigir等等)中出現的論文中基本都不會出現。

2. 資訊理論基礎

主要常用的概念:熵,條件熵,KL散度,以及這三者之間的關係,最大熵原理,資訊增益(information gain)

3. 分類

樸素貝葉斯,KNN,支援向量機,最大熵模型,決策樹的基本原理,以及優缺點,知道常用的軟體包

4. 聚類

非層次聚類的K-means演算法,層次聚類的類型及其區別,以及算距離的方法(如single,complete的區別a),知道常用的軟體包

5. EM演算法

理解不完全資料的推斷的困難,理解EM原理和推理過程

6. 蒙特卡洛演算法(特別是Gibbs採樣演算法o)

知道蒙特卡洛演算法的基本原理,特別瞭解Gibbs演算法的採樣過程;Markov 隨機過程和Markov chain等

7. 圖模型

圖模型最近幾年非常的熱,也非常重要,因為它能把之前的很多研究都包括在內,同時具有直觀之意義。如CRF, HMM,topic model都是圖模型的應用和特例。
a. 瞭解圖模型的一般表示(有向圖和無向圖模型x),通用的學習演算法(learning)和推斷演算法(inference),如Sum-product演算法,傳播演算法等
b.  熟悉HMM模型,包括它的假設條件,以及前向和後向演算法; 
c.  熟悉LDA模型,包括它的圖模型表示i,以及它的Gibbs 推理演算法;變分推斷演算法不要求掌握。
d. 瞭解CRF模型,主要是瞭解它的圖模型表示,如果有時間和興趣a,可以瞭解推理演算法;
e.  理解HMM,LDA, CRF和圖模型的一般表示,通用學習演算法和推理演算法之間的聯絡和差別;
f.  瞭解Markov logic network(MLN),這是建構在圖模型和一階邏輯基礎上的一種語言,可以用來描述很多現實問題,初步的瞭解,可以協助理解圖模型;

8. topic model

這個模型的思想被廣泛地應用,全看完沒有必有也沒有時間,推薦如下:
a. 深入理解pLSA和LDA,同時理解pLSA和LDA之間的聯絡和區別;這兩個模型理解後,大部分的topic model的論文都是可以理解的了,特別是應用到NLP上的topic  
model。同時,也可以自己設計自己需要的非層次topic model了。
b. 如果想繼續深入,繼續理解hLDA模型,特別是理解背後的數學原理Dirichlet Process,這樣你就可以自己設計層次topic model了;
c. 對於有監督的topic model,一定要理解s-LDA和LLDA兩個模型,這兩個模型體現了完全不同的設計思想,可以細細體會,然後自己設計自己需要的topic model;
d. 對於這些模型的理解,Gibbs 採樣演算法是繞不開的坎;

9. 最佳化和隨機過程

a. 理解約束條件是等號的最佳化問題及其lagrange乘子法求解;
b. 理解約束條件是不等號的凸最佳化問題,理解單純形法;
c. 理解梯度下降法,類比退火演算法;
d. 理解爬山法等最佳化求解的思想
e. 隨機過程需要瞭解隨機遊走,排隊論等基本隨機過程(論文中偶爾會有,但不是太常見n),理解Markov 隨機過程(非常重要,採樣理論中常用l);

10. 貝葉斯學習

  目前越來越多的方法或模型採用貝葉斯學派的思想來處理資料,因此瞭解相關的內容非常必要。
  a.  理解貝葉斯學派和統計學派的在思想和原理上的差別和聯絡;
  b.  理解損失函數,及其在貝葉斯學習中的作用;記住常用的損失函數;
  c.  理解貝葉斯先驗的概念和四種常用的選取貝葉斯先驗的方法;
  d.  理解參數和超參數的概念,以及區別;
  e.  通過LDA的先驗選取(或者其它模型i)來理解貝葉斯資料處理的思想;

11. 資訊檢索模型和工具

a.  理解常用的檢索模型;
b.  瞭解常用的開源工具(lemur,lucene等ng)

12. 模型選擇和特徵選取

a. 理解常用的特徵選取方法,從而選擇有效特徵來訓練模型;
b. 看幾個模型選擇的例子,理解如何選擇一個合適模型;(這玩意只能通過例子來意會了)

13. 論文寫作中的tricks

技巧是很多的,這裡略。

(新浪微博:@全亮_機器學習)


轉自:http://www.chinakdd.com/article-6c4R1BH7rXK0ome.html

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.