【資料採礦技術】關聯規則(Apriori演算法)

來源:互聯網
上載者:User

標籤:style   blog   color   使用   io   strong   檔案   資料   

一、關聯規則中的頻繁模式  

    關聯規則(Association Rule)是在資料庫和資料採礦領域中被發明並被廣泛研究的一種重要模型,關聯規則資料採礦的主要目的是找出:

【頻繁模式】:Frequent Pattern,即多次重複出現的模式和並發關係(Cooccurrence Relationships),即同時出現的關係,頻繁和並發關係也稱為關聯(Association).

 

二、應用關聯規則的經典案例:沃爾瑪超市中“啤酒和尿不濕”的經典營銷案例

  • 購物籃分析(Basket Analysis):通過分析顧客購物籃中商品之間的關聯,可以挖掘顧客的購物習慣,從而協助零售商可以更好地制定有針對性的營銷策略。

    以下列舉一個最簡單也最經典的關聯規則的例子:嬰兒尿不濕—>啤酒[支援度=10%,信賴度=70%]

       這個規則表明,在所有顧客中,有10%的顧客同時購買了嬰兒尿不濕和啤酒,而在所有購買了嬰兒尿不濕的顧客中,佔70%的人同時還購買了啤酒。發現這個關聯規則後,超市零售商決定把嬰兒尿不濕和啤酒擺在一起進行銷售,結果明顯提高了銷售額,這就是發生在沃爾瑪超市中“啤酒和尿不濕”的經典營銷案例。

 

三、支援度(Support)和信賴度(Confidence)

      事實上,支援度和信賴度是衡量關聯規則強度的兩個重要指標,他們分別反映著所發現規則有用性和確定性。 

【支援度】        規則X->Y的支援度:事物全集中包含X U Y的事物百分比。Support(A B)= P(A B)         支援度主要衡量規則的有用性,如果支援度太小,則說明相應規則只是輕負荷事件,在商業實踐中,輕負荷事件很可能沒有商業價值。【信賴度】        規則X->Y的信賴度:既包括X又包括Y的事物占所有包含了X的事物數量的百分比。Confidence(A B)= P(B|A)        信賴度主要衡量規則的確定性(可預測性),如果信賴度太低,那麼從X就很難可靠的推斷出Y來,信賴度太低的規則在實踐應用中也沒有太大用途。

 

四、Apriori演算法

【基本概念】
1 【資料庫(Transaction Database)】:儲存著二維結構的記錄集(D);2 【所有項集(Items)】:所有項目的集合(I);3 【記錄 (Transaction )】:在資料庫裡的一筆記錄(T,T屬於D);4 【項集(Itemset)】:同時出現的項的集合。定義為:k-itemset(k項集),k-itemset ? T。除非特別說明,否則下文出現的k均表示項數;5 【候選 集(Candidate itemset)】:通過向下合并得出的項集。定義為C[k];6 【強規則】:經過關聯規則分析後,針對某些人推銷(根據某規則)比盲目推銷(一般來說是整個資料)的比率,這個比率越高越好;7 【剪枝步】只有當子集都是頻繁集的候選集才是頻繁集,這個篩選的過程就是剪枝步;

 

    Apriori演算法是眾多的關聯規則資料採礦演算法中最著名的演算法,其核心是基於兩階段頻集思想的遞推演算法。該關聯規則在分類上屬於單維、單層、布爾關聯規則。

     該演算法具體分為以下兩步進行:

  1. 產生所有的頻繁項目集。一個頻繁項目集(Frequent Itemset)是一個支援度高於最小支援度閥值(min-sup)的項目集。
  2. 從頻繁項目集中產生所有的可信關聯規則。這裡可信關聯規則是指信賴度大於最小信賴度閥值(min-conf)的規則。

      然後使用第1步找到的頻集產生期望的規則,產生只包含集合的項的所有規則,其中每一條規則的右部只有一項,這裡採用的是中規則的定義。一旦這些規則被產生,那麼只有那些大於使用者給定的最小可信度的規則才被留下來。為了產生所有頻集,使用了遞迴的方法。

 【Apriori演算法】
Apriori演算法使用頻繁項集的先驗知識,使用一種稱作逐層搜尋的迭代方法,k項集用於探索(k+1)項集。 step1: 通過掃描事務(交易)記錄,找出所有的頻繁1項集,該集合記做L1;
step2: 利用L1找頻繁2項集的集合L2;
step3: L2找L3,
...
stepn: 如此下去,直到不能再找到任何頻繁k項集。
最後再在所有的頻繁集中找出強規則,即產生使用者感興趣的關聯規則。其中,Apriori演算法具有這樣一條性質:任一頻繁項集的所有非空子集也必須是頻繁的。因為假如P(I)< 最小支援度閾值,當有元素A添加到I中時,結果項集(A∩I)不可能比I出現次數更多。因此A∩I也不是頻繁的。

 

     然而,可能產生大量的候選集,以及可能需要重複掃描資料庫,是Apriori演算法的兩大缺點。

五、關聯規則演算法的用途

          關聯規則演算法不但在數值型資料集的分析中有很大用途,而且在純文字文檔和網頁檔案中,也有重要作用。比如發現單詞間的並發關係以及Web的使用模式等,這些都是Web資料採礦、搜尋及推薦的基礎。

 

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.