海量推薦系統:mapreduce的方法

來源:互聯網
上載者:User

標籤:style   blog   http   color   檔案   資料   io   2014   

1. Motivation


2. MapReduce

MapReduce是一種資料密集型並行計算架構。

待處理資料以“塊”為單位儲存在叢集機器檔案系統中(HDFS),並以(key, value)的索引值對形式儲存。

當任務啟動時,系統將計算任務分配給儲存資料的相應機器。

MapReduce計算任務可以劃分為兩個階段:

MapReduce資料流圖

?

3. scalable similarity-based neighborhood

3.1 user-based 推薦

說明:

:user對商品的評分

:得到了使用者u與其他使用者的相似性


最後,對於某一商品i,根據其他使用者的評分以及使用者相似性加權和來得到本使用者的預測評分。

之所以稱之為user-based方法,演算法基於計算使用者間的相似性。

3.2 item-based推薦

說明:

得到了物品的相似性矩陣。最後,使用者u對物品i的打分就等於使用者對物品的打分與物品i相似性的加權和。

因此,推薦系統的核心在於計算相似性矩陣

3.3 scalable計算方法

傳統的相似性計算,基於標準的矩陣乘法。

不足之處:

1、在每一個map任務中,要初始化評分矩陣A,map時將輸入的item與A的每一列做點乘。當矩陣A巨大時,記憶體消耗巨大。

2、傳統計算方法複雜度與item數的平方成正比。並且,不能利用user評分稀疏性的性質。

改進的方法

其中,為列向量,為使用者u的打分向量

具體方法:

首先對每一個使用者的評分向量做乘積。

然後將這些乘積相加,就得到了相似性矩陣。這樣,就可以以A的行向量為單位進行資料的劃分。

mapreduce計算架構

?

?

?

參考文獻:

[1]?Scalable Similarity-Based Neighborhood Methods with MapReduce?

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.