隨著資料庫技術的不斷髮展及資料庫管理系統的廣泛應用,資料庫中儲存的資料量急劇增大,在大量的資料背後隱藏著許
多重要的資訊,如果能把這些資訊從資料庫中抽取出來,將為公司創造很多潛在的利潤,而這種從海量資料庫中挖掘資訊
的技術,就稱之為資料採礦。
資料採礦工具能夠對將來的趨勢和行為進行預測,從而很好地支援人們的決策,比如,經過對公司整個資料庫系統的
分析,資料採礦工具可以回答諸如“哪個客戶對我們公司的郵件推銷活動最有可能作出反應,為什麼”等類似的問題。有
些資料採礦工具還能夠解決一些很消耗人工時間的傳統問題,因為它們能夠快速地瀏覽整個資料庫,找出一些專家們不易
察覺的極有用的資訊。
下文將對資料採礦的基本技術作一個簡單的介紹。
資料採礦的基礎
資料採礦技術是人們長期對資料庫技術進行研究和開發的結果。起初各種商業資料是儲存在電腦的資料庫中的,然
後發展到可對資料庫進行查詢和訪問,進而發展到對資料庫的即時遍曆。資料採礦使資料庫技術進入了一個更進階的階
段,它不僅能對過去的資料進行查詢和遍曆,並且能夠找出過去資料之間的潛在聯絡,從而促進資訊的傳遞。現在資料挖
掘技術在商業應用中已經可以馬上投入使用,因為對這種技術進行支援的三種基礎技術已經發展成熟,他們是:
海量資料搜集
強大的多處理器電腦
資料採礦演算法
商務資料庫現在正在以一個空前的速度增長,並且資料倉儲正在廣泛地應用於各種行業;對電腦硬體效能越來越高
的要求,也可以用現在已經成熟的並行多處理機的技術來滿足;另外資料採礦演算法經過了這10多年的發展也已經成為一種
成熟,穩定,且易於理解和操作的技術。
從商業資料到商業資訊的進化過程中,每一步前進都是建立在上一步的基礎上的。見下表。表中我們可以看到,第四
步進化是革命性的,因為從使用者的角度來看,這一階段的資料庫技術已經可以快速地回答商業上的很多問題了。
進化階段 商業問題 支援技術 產品廠家 產品特點
資料搜集
(60年代) “過去五年中我的總收入是多少?” 電腦、磁帶和磁碟 IBM, CDC 提供曆史性的、靜態資料資訊
資料訪問
(80年代) “在新英格蘭的分部去年三月的銷售額是多少?” 關聯式資料庫(RDBMS),結構化查詢語言 (SQL)(SQL),ODBC
Oracle、Sybase、Informix、IBM、Microsoft 在記錄級提供曆史性的、動態資料資訊
資料倉儲;決策支援
(90年代) “在新英格蘭的分部去年三月的銷售額是多少?波士頓據此可得出什麼結論?” 線上分析處理(OLAP)、多維
資料庫、資料倉儲 Pilot、Comshare、Arbor、Cognos、Microstrategy 在各種層次上提供回溯的、動態資料資訊
資料採礦
(正在流行) “下個月波士頓的銷售會怎麼樣?為什嗎?” 進階演算法、多處理器電腦、海量資料庫 Pilot、
Lockheed、IBM、SGI、其他初創公司 提供預測性的資訊
表一、資料採礦的進化曆程。
資料採礦的核心模組技術曆經了數十年的發展,其中包括數理統計、人工智慧、機器學習。今天,這些成熟的技術,
加上高效能的關聯式資料庫引擎以及廣泛的Data Integration,讓資料採礦技術在當前的資料倉儲環境中進入了實用的階段。
資料採礦的範圍
“資料採礦”這個名字來源於它有點類似於在山脈中挖掘有價值的礦藏。在商業應用裡,它就表現為在大型資料庫裡
面搜尋有價值的商業資訊。這兩種過程都需要對巨量的材料進行詳細地過濾,並且需要智能且精確地定位潛在價值的所
在。對於給定了大小的資料庫,資料採礦技術可以用它如下的超能力產生巨大的商業機會:
自動趨勢預測。資料採礦能自動在大型資料庫裡面找尋潛在的預測資訊。傳統上需要很多專家來進行分析的問題,現
在可以快速而直接地從資料中間找到答案。一個典型的利用資料採礦進行預測的例子就是目標營銷。資料採礦工具可以根
據過去郵件推銷中的大量資料找出其中最有可能對將來的郵件推銷作出反應的客戶。
自動探測以前未發現的模式。資料採礦工具掃描整個資料庫並辨認出那些隱藏著的模式,比如通過分析零售資料來辨
別出表面上看起來沒聯絡的產品,實際上有很多情況下是一起被售出的情況。
資料採礦技術可以讓現有的軟體和硬體更加自動化,並且可以在升級的或者新開發的平台上執行。當資料採礦工具運
行於高效能的平行處理系統上的時候,它能在數分鐘內分析一個超大型的資料庫。這種更快的處理速度意味著使用者有更多
的機會來分析資料,讓分析的結果更加準確可靠,並且易於理解。
資料庫可以由此拓展深度和廣度
深度上,允許有更多的列存在。以往,在進行較複雜的資料分析時,專家們限於時間因素,不得不對參加運算的變數
數量加以限制,但是那些被丟棄而沒有參加運算的變數有可能包含著另一些不為人知的有用資訊。現在,高效能的資料挖
掘工具讓使用者對資料庫能進行通盤的深度編曆,並且任何可能參選的變數都被考慮進去,再不需要選擇變數的子集來進行
運算了。
廣度上,允許有更多的行存在。更大的樣本讓產生錯誤和變化的機率降低,這樣使用者就能更加精確地推匯出一些雖小
但頗為重要的結論。
最近,Gartner Group的一次進階技術調查將資料採礦和人工智慧列為“未來三到五年內將對工業產生深遠影響的五大
關鍵技術”之首,並且還將平行處理體系和資料採礦列為未來五年內投資焦點的十大新興技術前兩位。根據最近Gartner的
HPC研究表明,“隨著資料擷取、傳輸和儲存技術的快速發展,大型系統使用者將更多地需要採用新技術來挖掘市場以外的價
值,採用更為廣闊的平行處理系統來建立新的商業增長點。”
在資料採礦中最常用的技術有:
人工神經網路:仿照生理神經網路結構的非線形預測模型,通過學習進行模式識別。
決策樹:代表著決策集的樹形結構。
遺傳演算法:基於進化理論,並採用遺傳結合、遺傳變異、以及自然選擇等設計方法的最佳化技術。
近鄰演算法:將資料集合中每一個記錄進行分類的方法。
規則推導:從統計意義上對資料中的“如果-那麼”規則進行尋找和推導。
採用上述技術的某些專門的分析工具已經發展了大約十年的曆史,不過這些工具所面對的資料量通常較小。而現在這
些技術已經被直接整合到許多大型的工業標準的資料倉儲和聯機分析系統中去了。
資料採礦工具是怎樣準確地告訴你那些隱藏在資料庫深處的重要訊息的呢?它們又是如何作出預測的?答案就是建模。建
模實際上就是在你知道結果的情況下建立起一種模型,並且把這種模型應用到你所不知道的那種情況中。比如說,如果你
想要在大海上去尋找一艘古老的西班牙沉船,也許你首先想到的就是去找找過去發現這些寶藏的時間和地點有哪些。那
麼,經過調查你發現這些沉船大部分都是在百慕達海區被發現,並且那個海區有著某種特徵的洋流,以及那個時代的航線
也有一定的特徵可尋。在這眾多的類似特徵中,你將它們抽象並概括為一個普適的模型。利用這個模型,你就很有希望在
具有大量相同特徵的另外一個地點發現一件不為人知的寶藏。
當然,在資料採礦技術甚至電腦出現以前,這種建模抽象的方法就已經廣泛地被人們所使用。在電腦中的建模和
以前的建模方法並無很大不同,主要的差異在於電腦能處理的資訊量比起以前來更加龐大。電腦中能夠儲存已知了結
果的大量不同情況,然後由資料採礦工具從這些大量的資訊裡面披沙揀金,將能夠產生模型的資訊提取出來。一當模型建
立好了之後,就可以應用在那些情形相似但結果尚未知的判斷中了。比如,現在假設你是一個電信公司的營銷主任,公司
想發展一些新的長途電話使用者,那麼你是不是會漫無目的地到街上去散發廣告呢?——就象漫無目的地在海上去尋寶一
樣。其實,比起漫無目的地去進行宣傳來,利用你以前的商業經驗來有目的地去拉攏客戶會產生高得多的效率。
作為一個營銷主任,你對客戶的很多資訊都可以瞭解得一清二楚:年齡、性別、信用記錄以及長途電話使用狀況。從
好的一方面來看,掌握了這些客戶的資訊其實就是掌握了很多潛在的使用者的同樣的資訊。問題在於你還不一定瞭解他們的
長途電話使用方式(因為他們的長途電話也許是通過的另一個電信公司)。現在你的主要精力就集中在使用者中誰有比較多
的長途電話上。通過下面這個表格,我們可以從資料庫裡面抽象某些變數,建立起一個可以對此進行分類營銷的模型。
客戶 潛力
一般資訊
(e.g. demographic data) 已知 已知
私人資訊
(e.g. customer transactions) 已知 待定
表二、資料採礦應用於分類營銷
根據我們建立的從一般資訊到私人資訊的計算模型,我們可以得出表二右下方表格中的資訊。比如,一個電信公司的
簡化模型可以是:年薪6萬美圓以上的98%的客戶,每個月長話費80美圓以上。根據這個模型,我們就能應用這些資料來推
斷出公司現在尚不能明確的私人資訊,這樣,新客戶群體就可以大體確定出來了。小型市場的試銷資料對於這樣的模型來
說顯得極為有用。因為小範圍內試銷資料的挖掘,能夠為全部市場的分類銷售打下一個良好的基礎。表三則描述了另外一
樣資料採礦的普遍應用:預測。
過去 現在 將來
靜態資訊和當前計劃 已知 已知 已知
動態資訊 已知 已知 待定
表三、資料採礦應用於預測
資料採礦的體繫結構
現有很多資料採礦工具是獨立於資料倉儲以外的,它們需要獨立地輸入輸出資料,以及進行相對獨立的資料分析。為
了最大限度地發揮資料採礦工具的潛力,它們必須象很多商務分析軟體一樣,緊密地和資料倉儲整合起來。這樣,在人們
對參數和分析深度進行變化的時候,高整合度就能大大地簡化資料採礦過程。顯示了一個大型資料庫中的進階分析過
程。
整合後的資料採礦體系
應用資料採礦技術,較為理想的起點就是從一個資料倉儲開始,這個資料倉儲裡面應儲存著所有客戶的合約資訊,並
且還應有相應的市場競爭者的相關資料。這樣的資料庫可以是各種市場上的資料庫:Sybase、Oracle、Redbrick、和其
他等等,並且可以針對其中的資料進行速度上和靈活性上的最佳化。
聯機分析系統OLAP伺服器可以使一個十分複雜的終端使用者商業模型應用於資料倉儲中。資料庫的多維度結構可以讓使用者
從不同角度,——比如產品分類,地區分類,或者其他關鍵角度——來分析和觀察他們的生意運營狀況。資料採礦伺服器
在這種情況下必須和聯機分析伺服器,以及資料倉儲緊密地整合起來,這樣就可以直接跟蹤資料和並輔助使用者快速作出商
業決策,並且使用者還可以在更新資料的時候不斷髮現更好的行為模式,並將其運用於未來的決策當中。
資料採礦系統的出現代表著常規決策支援系統的基礎結構的轉變。不象查詢和報表語言僅僅是將資料查詢結果反饋給
終端使用者那樣,資料採礦進階分析伺服器把使用者的商業模型直接應用於其資料倉儲之上,並且反饋給使用者一個相關資訊的
分析結果。這個結果是一個經過分析和抽象的動態視圖層,通常會根據使用者的不同需求而變化。基於這個視圖,各種報表
工具和視覺化檢視就可以將分析結果展現在使用者面前,以協助使用者計劃將採取怎樣的行動。
產生利潤的工具
有很多公司都成功地安裝了資料採礦工具。早先採用了這種技術的公司大部分都是資訊密集型公司,比如金融服務和
郵件營銷系統,但是現在這種技術已經準備好應用於各個公司中,只要公司具有大型資料庫,並且有強烈的通過軟體技術
改善公司管理的願望。但是採用資料採礦技術,公司必須兩個關鍵的因素,一個就是大型的,整合化的資料庫;另一個就
是定義完善的商業處理常式,這樣資料採礦才好緊密地應用於公司資料之上。
採用資料採礦技術的一些成功應用,例如一個藥品公司,通過對它最近的營銷強度和銷售結果的分析,來決定哪一種
營銷活動在最近幾個月內對高附加值的醫生群體影響最大,這樣的分析建立在競爭者的銷售活動資訊和當地健康情況的
資料系統之上。然後這個藥品公司可以通過其辦公網路,將分析結果傳達到各地的銷售代表處,銷售代表們則可以根據公
司傳遞的關鍵資訊來作出相應的銷售抉擇,這樣,在快速變化的、動態市場上,銷售代表們都可以根據各種特殊情況的
分析作出最優的選擇。
結語
全面整合了客戶、供應者以及市場資訊的大型資料倉儲導致公司內的資訊呈爆炸性增長,企業在市場競爭中,需要及
時而準確地對這些資訊作複雜的分析。為了更加及時地,更加準確地作出利於企業的抉擇,建立在關聯式資料庫和聯機分析
技術上的資料採礦工具為我們帶來了一個新的轉機。目前,資料採礦工具正以前所未有的速度發展,並且擴大著使用者群
體,在未來越加激烈的市場競爭中,擁有資料採礦技術必將比別人獲得更快速的反應,贏得更多的商業機會。
電腦世界開發人員俱樂部 http://dev-club.esnai.com