標籤:style blog color os io strong 資料 art
聚類(Clustering)分析有一個通俗的解釋和比喻,那就是“物以類聚,人以群分”。針對幾個特定的業務指標,可以將觀察對象的群體按照相似性和相異性進行不同群組的劃分。經過劃分後,每個群組內部個對象間的相似性會很高,而在不同群組之間的對象彼此間將具有很高的相異度。
聚類技術一方面本身就是一種模型技術,通過有效聚類後的結果常常可以直接指導落地應用實踐;另一方面聚類技術又常常作為資料分析過程中前期進行資料摸底和資料清洗、資料整理(資料轉換)的工具,在實踐應用中有多樣性、多元性等特點。
一、群集的典型應用情境
可以說,群集的典型應用情境是非常普遍的,業務團隊幾乎每天都要碰到。比如說,把付費使用者按照幾個特定的唯獨,如利率貢獻率、使用者年齡、續約次數等進行群集,得到不同特徵的群體。
舉個例子:在將付費使用者進行群集後,其中一個群體所佔的付費人數是40%,其特徵的使用者年齡是25歲左右,利潤貢獻不大,但是續約次數多;
另外一個群體,佔總付費用人數的15%,而該特徵的群體是使用者年齡咋40歲以上,利潤貢獻比較大,但是續約次數不多。
對於運營方來說,這兩個典型
二、主要聚類演算法分類
群集的演算法可以劃分為:
- 劃分的方法(Partitioning Method);
- 層次的方法(Hierarchical Method);
- 基於密度的方法(Density-based Method);
- 基於網格的方法(Grid-based Method);
- 基於模型的方法(Model-based Method)
等,其中,前面兩種方法最常用。
1、劃分的方法(Partitioning Method)
當給定m個對象的資料集,以及希望產生的細分群體數量K後,即可採用這種方法將這些對象分為K組(要求K不超過m),使得每個組內對象時想死的,而組建是相異的。最常用的方法是K-Means方法,其具體原理是:
1 【K-Means方法】2 step1: 隨機播放K個對象,並且所選擇的每個對象都代表一個組的初始均值或初始組中心值;3 step2: 對剩餘的每個對象,根據其餘各個組初始均值或初始中心值得距離遠近,將他們分配給最近的(最相似)小組;4 step3: 重新計算每個小組新的均值;5 ....6 這個過程不斷彷彿,知道所有的對象在K組分布中都找到離自己最近的組。
2、層次的方法(Hierarchical Method)
指依次讓最相似的資料對象兩兩合并,這樣不斷的合并,最終就形成了一個聚類數。
三、聚類技術的應用
聚類技術在資料分析和資料化運營中的主要用途表現在:及尅直接作為模型對觀察對現象進行群體劃分,為業務方面精細化運營提供具體的細分依據和相應的運營方案建議,又可在資料處理階段用作資料探索的工具,包括髮現離散點、孤立點、資料降維的手段和方面。通過聚類探索資料間的深層次的關係等。
四、聚類技術的擴充應用
的