BI構架及相關技術簡介(下)

來源:互聯網
上載者:User

  3)資料分析:OLAP和資料採礦

  OLAP與資料採礦是一個有機的整體,在OLAP中必定要針對不同的主題資料倉儲採用相應的資料採礦演算法來進行資料分析。如果把資料倉儲對BI系統的作用比作廚師的食材,那麼,OLAP和資料採礦則是廚具。

  線上分析處理(OLAP)的概念最早是由關聯式資料庫之父E.F.Codd於1993年提出的,其目的是為了讓管理者靈活地對海量資料進行瀏覽分析。當時,Codd認為聯機交易處理(OLTP)已不能滿足終端使用者對資料庫查詢分析的需要,SQL對大資料庫進行的簡單查詢也不能滿足使用者分析的需求。使用者的決策分析需要對關聯式資料庫進行大量計算才能得到結果,而查詢的結果並不能滿足決策者提出的需求。因此Codd提出了多維資料庫和多維分析的概念,即OLAP。Codd提出OLAP的12條準則來描述OLAP系統:
  準則1 OLAP模型必須提供多維概念視圖
  準則2 透明性準則
  準則3 存取能力推測
  準則4 穩定的報表能力
  準則5 客戶/伺服器體繫結構
  準則6 維的等同性準則
  準則7 動態疏鬆陣列處理準則
  準則8 多使用者支援能力準則
  準則9 非受限的跨維操作
  準則10 直觀的資料操縱
  準則11 靈活的報表產生
  準則12 不受限的維與聚集層次

  和傳統的聯機交易處理(OLTP)相比,兩者的區別很大,具體情況如下表:

   OLTP OLAP 
 使用者

操作人員,低層管理員 

決策人員,進階管理員 

功能 

日常操作處理

分析決策 

 DB設計

面嚮應用 

面向主題 

 資料

當前的, 最新的細節的,二維的分立的 

曆史的, 聚集的, 多維的整合的, 統一的 

 存取

讀/寫數十條記錄

讀上百萬條記錄 

 工作單位

簡單的事務 

複雜的查詢 

 使用者數

上千個

上百個 

 DB大小

100MB ~ GB

100GB ~ TB 

  利用多維的概念,OLAP提供了切片、切塊、下鑽、上卷和旋轉等多維度分析與跨維度分析功能。相對於普通的靜態報表,OLAP更能滿足決策者和分析人員對資料倉儲資料的分析。OLAP系統架構主要分為基於關聯式資料庫的ROLAP(Relational OLAP)、基於多維資料庫的MOLAP(Multidimensional OLAP)、基於混合資料群組織的HOLAP(Hybrid OLAP)三種。前兩種方式比較常見。ROLAP表示基於關聯式資料庫的OLAP實現。它以關聯式資料庫為核心,以關係型結構進行多維資料的表示和儲存。ROLAP將多維資料庫的多維度結構劃分為兩類表:一類是事實表,用來儲存資料和維關鍵字;另一類是維表,即對每個維至少使用一個表來存放維的層次、成員類別等維的描述資訊。MOLAP表示基於多維資料群組織的OLAP實現。它以多維資料群組織方式為核心,使用多維陣列儲存資料。MOLAP查詢方式採用索引搜尋與直接定址相結合的方式,比ROLAP的表索引搜尋和表串連方式速度要快得多。
  
  資料採礦(Data Mining,DM)是指從大量不完全的、有雜訊的、模糊的、隨機的資料中,提取隱含在其中的、有用的資訊和知識的過程。其表現形式為概念(Concepts)、規則(Rules)、模式(Patterns)等形式。

  從商業層來看,我個人認為,在商業智慧系統中進行資料採礦的目標大致可分為兩類:
  ①從累積的業務資料中發掘出管理層事先不知道的、但又是潛在有用的資訊,為其創造新的商業機會。商業銷售已有大量這方面的運用執行個體,BI業內流傳已久的“啤酒和尿布”,以及我在本文開頭所舉的例子就屬此類。
  ②從累積的業務資料中尋求最優的資源規劃方案,降低成本,從而提高利潤。讓我們先從大家可能都想過一個例子談起——郵遞員送信,假設我是某個城市的郵遞員,一次要送出多封信件,收信人的住址分布在城市的各個街道上。那麼該如何設計線路,來儘可能的減少行程呢?商務工作中出現大量類似的例子,當可供分析的資料不多時,我們可以用紙筆來手工計算,找到最優解。但是,如果未經處理資料量極為龐大的話,我們將不得不求助於電腦了。

  目前業內已有很多成熟的資料採礦方法論,為實際應用提供了理想的指導模型。CRISP-DM(Cross-Industry Standard Process for Data Mining)就是公認的、較有影響的方法論之一。CRISP-DM強調,DM不單是資料的組織或者呈現,也不僅是資料分析和統計建模,而是一個從理解業務需求、尋求解決方案到接受實踐檢驗的完整過程。CRISP-DM將整個挖掘過程分為以下六個階段:商業理解(Business Understanding),資料理解(Data Understanding),資料準備(Data Preparation),建模(Modeling),評估(Evaluation)和發布(Deployment)。其架構圖如下:

  商業理解就是對企業運作、商務程序和行業背景的瞭解;資料理解是對現有公司專屬應用程式系統的瞭解;資料準備就是從企業大量資料中取出一個與要探索問題相關的樣板資料子集。建模是根據對業務問題的理解,在資料準備的基礎上,選擇一種更為實用的採礦模型,形成挖掘的結論。評估就是在實際中檢驗挖掘的結論,如果達到了預期的效果,就可將結論發布。

  在實際項目中,一般的交易處理系統甚至一些只提供報表分析功能的簡單商業智慧系統,建成以後只需要少量的工程維護工作,而採用資料採礦技術的商業智慧系統往往有很大不同。因為資料採礦是一個商業理解、資料理解、建模、評估等一系列多次反覆、多次調整、不斷修訂完善的過程,並且模型的應用也不是一成不變的,在適當的時候需要更新和重建。所以一般的商業智慧項目並不追求一次性工程建設,更倡導的是一種與企業業務緊密聯絡能夠提升企業競爭力的諮詢服務,而且熟悉業務和分析方法的分析人員在商業智慧系統的應用中起著至關重要的作用。

  從技術層來看,資料採礦技術可分為描述型資料採礦和預測型資料採礦兩種。描述型資料採礦包括資料總結、聚類及關聯分析等。預測型資料採礦包括分類、迴歸及時間序列分析等。
  1、資料總結:繼承於資料分析中的統計分析。資料總結目的是對資料進行濃縮,給出它的緊湊描述。傳統統計方法如求和值、平均值、方差值等都是有效方法。另外還可以用長條圖、餅狀圖等圖形方式表示這些值。廣義上講,多維分析也可以歸入這一類。
  2、聚類:是把整個資料庫分成不同的群組。它的目的是使群與群之間差別很明顯,而同一個群之間的資料盡量相似。這種方法通常用於客戶細分。在開始細分之前不知道要把使用者分成幾類,因此通過群集可以找出客戶特性相似的群體,如客戶消費特性相似或年齡特性相似等。在此基礎上可以制定一些針對不同客戶群體的營銷方案。
  3、關聯分析:是尋找資料庫中值的相關性。兩種常用的技術是關聯規則和序列模式。關聯規則是尋找在同一個事件中出現的不同項的相關性;序列模式與此類似,尋找的是事件之間時間上的相關性,如對股票漲跌的分析等。
  4、分類:目的是構造一個分類函數或分類模型(也常常稱作分類器),該模型能把資料庫中的資料項目映射到給定類別中的某一個。要構造分類器,需要有一個訓練樣本資料集作為輸入。訓練集由一組資料庫記錄或元組構成,每個元組是一個由有關欄位(又稱屬性或特徵)值組成的特徵向量,此外,訓練樣本還有一個類別標記。一個具體樣本的形式可表示為:( v1, v2, ...,vn;c ),其中vi表示欄位值,c表示類別。
  5、迴歸:是通過具有已知值的變數來預測其它變數的值。一般情況下,迴歸採用的是線性迴歸、非線性迴歸這樣的標準統計技術。一般同一個模型既可用於迴歸也可用於分類。常見的演算法有羅吉斯迴歸、決策樹、神經網路等。
  6、時間序列:時間序列是用變數過去的值來預測未來的值。

  早期由於資料採礦的理論和相關技術尚不成熟,軟體廠商並未為其資料庫產品開發相應的資料採礦工具,但當時已有少部分大型企業有這方面的技術需求。所以,市場上出現了一些獨立的資料採礦工具,如SAS公司的Enterprise Miner、IBM公司的Intelligent Miner、SPSS公司的Clementine、Anomaly Detect,、Sequence Analysis和 Deviation Analysis(感謝怡紅公子補充)。現在,隨著相關技術的日益成熟,越來越多的企業提出這樣的技術需求,軟體廠商也意識到其中的潛力,估計在未來的3~5年內,將會出現整合在資料倉儲中完備的資料採礦工具。

  最後要提醒大家的是,儘管商業智慧應用的前景光明,但是BI業內還沒有形成一個統一的標準。而且,由於BI系統的實施是一個長期的、迭代的過程,企業在這個過程中肯定會出現短期利潤倒退的情況,這也在很大程度上打擊了企業的信心和實踐熱情。所以,目前絕大多數企業都對此持觀望態度,或只在有限的部門內局部實施BI。我個人認為,企業這樣做也是相當明智的。但儘管是局部實施,機會還是有的。作為技術人員,可以爭取在相關技術的研發上取得突破;作為軟體廠商的話,則應從現有老客戶和現有產品的技術升級中尋求機會。

[參考資料]
一、參考書目
1、W.H. Inmon, 《Building the Data Warehouse:Third Edition》(資料倉儲)
2、David Marco, 《Building and managing the Meta Data Repository A Full lifecycle Guide》(中繼資料倉儲的構建於管理)
3、David Hand,Heikki Mannila,Padhraic Smyth, 《Rrinciples of Data Mining》(資料採礦原理)
4、Olivia Parr Rud, 《Data Mining Cookbook:Modeling Data for marketing,Risk,and Custormer Relationship Management》(資料採礦實踐)

二、參考文獻
1、王茁, “商務智能是什麼、不是什嗎?”
2、楊林, “正確理解商業智慧”
3、吳斌博士, “商業智慧的技術與實踐”
4、Unknown, many smart technical articles searched by google

三、資料來源
1、Bookshop
2、Technical Magazine
3、http://www.google.com/
4、http://www.chinabi.net/
5、http://www.dmresearch.net/
6、http://www.amteam.org/

  ·BI構架及相關技術簡介(上)
  ·BI構架及相關技術簡介(中)

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.