標籤:style 使用 os io strong 檔案 資料 for
下面內容摘自互連網並作了整理。
名詞:
BI(Business Intelligence):商業智慧,
DW(Data Warehouse):資料倉儲,詳見本文Q1部分。
OLTP(On-Line Transaction Processing):聯機交易處理
也稱為面向交易的處理系統,其基本特徵是顧客的未經處理資料能夠馬上傳送到計算中心進行處理,並在非常短的時間內給出處理結果。這樣做的最大長處是能夠即時地處理輸入的資料,及時地回答。也稱為即時系統(Real time System)。衡量聯機交易處理系統的一個重要效能指標是系統效能,詳細體現為即時回應時間(Response Time),即使用者在終端上送入資料之後,到電腦對這個請求給出回覆所須要的時間。
OLTP 資料庫旨在使事務應用程式僅寫入所需的資料,以便儘快處理單個事務。
OLAP(On-Line Analytical Processing):線上分析處理
OLAP是E.F.Codd於1993年提出的。
OLAP理事會的定義:OLAP是一種軟體技術,他使分析人員可以迅速、一致、互動地從各個方面觀察資訊,以達到深入理解資料的目的,這些資訊是從未經處理資料直接轉換過來的,他們以使用者easy理解的方式反映企業的真實情況。
OLAP大部分策略都是將關係型的或普通的資料進行多維資料存貯,以便於進行分析,從而達到線上分析處理的目的。這樣的多維DB也被看作一個超立方體,沿著各個維方向存貯資料,它同意使用者沿事物的軸線方便地分析資料,與主流業務型使用者相關的分析形式一般有切片和切塊以及下鑽、挖掘等操作。
DataMart:資料集市,為了特定的應用目的或應用範圍,而從資料倉儲中獨立出來的一部分資料,也可稱為部門資料或主題資料(subjectarea)。在資料倉儲的實施過程中往往能夠從一個部門的資料集市著手,以後再用幾個資料集市組成一個完整的資料倉儲。須要注意的就是再實施不同的資料集市時,同一含義的欄位定義一定要相容,這樣再以後實施資料倉儲時才不會造成大麻煩。
Data Mining:資料採礦,詳見本文Q5部分
ETL:ETL各自是“Extract”、“ Transform” 、“Load”三個單詞的首字母縮寫也就是“抽取”、“轉換”、“裝載”,但我們日常往往簡稱其為資料幫浦。ETL是BI/DW(商務智能/資料倉儲)的核心和靈魂,依照統一的規則集成並提高資料的價值,是負責完畢資料從資料來源向目標資料倉儲轉化的過程,是實施資料倉儲的重要步驟。
MetaData:中繼資料,中繼資料是描寫敘述資料倉儲內資料的結構和建立方法的資料。可將其按用途的不同分為兩類,技術中繼資料和商業中繼資料。技術中繼資料是資料倉儲的設計和管理員用於開發和日常管理資料倉儲是用的資料。包含:資料來源資訊;資料轉換的描寫敘述;資料倉儲內對象和資料結構的定義;資料清理和資料更新時用的規則;來源資料到目的資料的映射;使用者訪問許可權,資料備份記錄,資料匯入記錄,資訊公布記錄等。
商業中繼資料從商業業務的角度描寫敘述了資料倉儲中的資料。包括:業務主題的描寫敘述,包括的資料、查詢、報表;
中繼資料為訪問資料倉儲提供了一個資訊檔夾(informationdirectory),這個檔案夾全面描寫敘述了資料倉儲中都有什麼資料、這些資料怎麼得到的、和怎麼訪問這些資料。是資料倉儲執行和維護的中心,資料倉儲server利用他來存貯和更新資料,使用者通過他來瞭解和訪問資料。
Q1:什麼是資料倉儲?
資料倉儲是一個面向主題的( Subject Oriented) 、整合的( Integrate) 、相對穩定的(NonVolatile) 、反映曆史變化( Time Variant)的資料集合,用於支援管理決策。對於資料倉儲的概念我們能夠從兩個層次予以理:①資料倉儲用於支援決策,面向分析型資料處理,它不同於企業現有的操作型資料庫;②資料倉儲是對多個異構資料來源的有效整合,整合後依照主
題進行了重組,並包括曆史資料,並且存放在資料倉儲中的資料一般不再改動。企業資料倉儲的建設是以現有企業業務系統和大量業務資料的積累為基礎。資料倉儲不是靜態概念,僅僅有把資訊及時交給須要這些資訊的使用者,供他們作出改善其業務經營的決策,資訊才幹發揮作用,資訊才有意義。而把資訊加以整理、歸納和重組,並及時提供給對應的管理決策人員是資料倉儲的根本任務。
Q2:為什麼要建立資料倉儲?
企業建立資料倉儲是為了填補現有資料存放區形式已經不能滿足資訊分析的須要。資料倉儲理論中的一個核心理念就是:事務型資料和決策支援型資料的處理效能不同。
企業在它們的事務操作收集資料。在企業運作過程中:隨著定貨、銷售記錄的進行,這些事務型資料也連續的產生。為了引入資料,我們必須最佳化事務型資料庫。
處理決策支援型資料時,一些問題常常會被提出:哪類客戶會購買哪類產品?促銷後銷售額會變化多少?價格變化後或者商店地址變化後銷售額又會變化多少呢?在某一段時間內,相對其它產品來說哪類產品特別easy賣呢?哪些客戶添加了他們的購買額?哪些客戶又削減了他們的購買額呢?
事務型資料庫能夠為這些問題作出解答,可是它所給出的答案往往並不能讓人十分愜意。在運用有限的電腦資源時經常存在著競爭。在添加新資訊的時候我們須要事務型資料庫是空暇的。而在解答一系列詳細的有關資訊分析的問題的時候,系統處理新資料的有效性又會被大大減少。還有一個問題就在於事務型資料總是在動態變化之中的。決策支援型處理須要相對穩定的資料,從而問題都能得到一致連續的解答。
資料倉儲的解決方案包含:將決策支援型資料處理從事務型資料處理中分離出來。資料依照一定的周期(通常在每晚或者每周末),從事務型資料庫中匯入決策支援型資料庫——既“資料倉儲”。資料倉儲是按回答企業某方面的問題來分“主題”組織資料的,這是最有效資料群組織方式。
另外,企業日常運作的資訊系統通常是由多個傳統系統、不相容資料來源、資料庫與應用所共同構成的複雜資料集合,各個部分之間不能彼此交流。從這個層面看:眼下執行的應用系統是使用者花費了非常大精力和財力構建的、不可替代的系統,特別是系統的資料。而建立資料倉儲的目的就是要把這些不同來源的資料整合組織起來統一管理,從而做到資料的一致性與整合化,提供一個全面的,單一入口的解決方式。這個讓我聯想到SOA的理念,只是前者是資料層面的整合最佳化,後者是應用服務層面的整合最佳化。
Q3:資料倉儲的一般結構是如何的?
1.體繫結構:
(1)資料來源是資料倉儲系統的基礎,是整個系統的資料來源泉,通常包含企業內部資訊和外部資訊。
(2)資料的儲存與管理是整個資料倉儲系統的核心。資料倉儲依照資料的覆蓋範圍能夠分為企業級資料倉儲和部門級資料倉儲(通常稱為資料集市) 。
(3)OLAP (On Line Analytical Processing)server對分析須要的資料進行有效整合,按多維模型予以組織,以便進行多角度、多層次的分析,並發現趨勢。
(4)前端工具主要包含各種報表工具、查詢工具、資料分析工具、資料採礦工具以及各種基於資料倉儲或資料集市的應用開發工具。
2.事實表和維表
事實表和維表是多維模型中的兩個基本概念。
事實表是資料分析所相應的主要資料項目,通常是企業內的某項業務或某個事件。事實表中的事實一般具有資料特性和可加性,事實表中能夠儲存不同粒度的資料,同一主題中不同粒度的資料一般儲存在不同的事實表中。
維表中包括的通常是描寫敘述性的文本資訊,這些文本資訊將成為事實表的檢索條件。維表中的維屬性應該詳細明白,體現出維層次的劃分,可以成為分析型查詢的約束條件,這是資料倉儲與操作型應用在資料模型設計上的一個不同點。維表層次的層級數量取決於查詢 的粒度。在實際業務環境中,多維資料模型一般含有4~15維,很多其它的維數或更少的維數一般都非常少見。在詳細工作中,設計人員一定要依據企業的實際情況確定對應的維。
在多維模型中,事實表的主碼是組合碼,維表的主碼是簡單碼,事實表中與維表主碼相相應的各個組成部分是外碼。事實表通過與各維相相應的外碼值同維表聯絡在一起。查詢時通過事實表和維表之間的這樣的相應關係。
3.資料群組織結構:
星型模型
多維資料建模以直觀的方式組織資料,並支援高效能的資料訪問。每個多維資料模型由多個多維資料模式表示,每個多維資料模式都是由一個事實表和一組維表組成的。多維模型最常見的是星形模式。在星形模式中,事實表置中,多個維表呈輻射狀分佈於其四周,並與事實表串連。
位於星形中心的實體是指標實體,是使用者最關心的基底實體和查詢活動的中心,為資料倉儲的查詢活動提供定量資料。每一個指標實體代表一系列相關事實,完畢一項指定的功能。位於星形圖星角上的實體是維度實體,其作用是限制使用者的查詢結果,將資料過濾使得 從指標實體查詢返回較少的行,從而縮小訪問範圍。每一個維表有自己的屬性,維表和事實表通過keyword相關聯。
雪花模型
雪花模型是對星型模型的擴充,每一個維度都可向外串連到多個具體類別表。在這樣的
模式中。維度資料表除了具有星型模型中的維度資料表功能外,還串連上對事實表
進行具體描寫敘述的洋細類別表。具體類別表通過對事實表在有關維上的具體描寫敘述,達到了
縮小事實表、提高查詢效率的目的。
Q4:怎樣設計並建立資料倉儲?
設計資料倉儲的九個步驟
1)選擇合適的主題(所要解決這個問題的領域)
2)明白定義fact表
3)確定和確認維
4)choosing the facts
5)計算並儲存fact表中的衍生資料區段
6)rounding out the dimension tables
7)choosing the duration of the database
8)the need to track slowly changing dimensions
9)確定查詢優先順序和查詢模式。
技術上
硬體平台:資料倉儲的硬碟容量通常要是操作資料庫硬碟容量的2-3倍。通常大型主機具有更可靠的效能和和穩定性,也easy與曆史遺留的系統結合在一起;而PCserver或UNIXserver更加靈活,easy操作和提供動態產生查詢請求進行查詢的能力。選擇硬體平台時要考慮的問題:是否提供並行的I/O吞吐?對多CPU的支援能力怎樣?
資料倉儲DBMS:他的儲存大資料量的能力、查詢的效能、和對平行處理的支援怎樣。
網路結構:資料倉儲的實施在那部分網路段上會產生大量的資料通訊,需不須要對網路結構進行改進。
實現上
建立資料倉儲的步驟
1)收集和分析業務需求
2)建立資料模型和資料倉儲的實體設計
3)定義資料來源
4)選擇資料倉儲技術和平台
5)從操作型資料庫中抽取、轉化、和裝載資料到資料倉儲
6)選擇訪問和報表工具
7)選擇資料庫連接軟體
8)選擇資料分析和資料展示軟體
9)更新資料倉儲
資料幫浦、清理、轉換、和移植
1)資料轉換工具要能從各種不同的資料來源中讀取資料。
2)支援一般檔案、索引檔案、和legacyDBMS。
3)能以不同類型資料來源為輸入整合資料。
4)具有規範的資料訪問介面
5)最好具有從資料字典中讀取資料的能力
6)工具產生的程式碼必須是在開發環境中可維護的
7)能僅僅抽取滿足指定條件的資料,和來源資料的指定部分
8)能在抽取中進行資料類型轉換和字元集轉換
9)能在抽取的過程中計算產生衍生欄位
10)能讓資料倉儲管理系統自己主動調用以定期進行資料幫浦工作,或能將結果產生一般檔案
11)必須對軟體供應商的生命力和產品支援能力進行細緻評估
Q5:什麼是資料採礦?
資料採礦(Data Mining)就是從大量的、不全然的、有雜訊的、模糊的、隨機的實際應用資料中,提取隱含在當中的、人們事先不知道的、但又是潛在實用的資訊和知識的過程。
資料採礦是一門交叉學科,它把人們對資料的應用從低層次的簡單查詢,提升到從資料中挖掘知識,提供決策支援。在這樣的需求牽引下,匯聚了不同領域的研究者,尤其是資料庫技術、人工智慧技術、數理統計、可視化技術、並行計算等方面的學者和project技術人員,投身到資料採礦這一新興的研究領域,形成新的技術熱點。
Q6:怎樣進行資料採礦?
1. 確定業務對象
清晰地定義出業務問題,認清資料採礦的目的是資料採礦的重要一步。挖掘的最後結構是不可預測的,但要探索的問題應是有預見的,為了資料採礦而資料採礦則帶有盲目性,是不會成功的。
2. 資料準備
1) 資料的選擇
搜尋全部與業務對象有關的內部和外部資料資訊,並從中選擇出適用於資料採礦應用的資料。
2) 資料的預先處理
研究資料的品質,為進一步的分析作準備。並確定將要進行的挖掘操作的類型。
3) 資料的轉換
將資料轉換成一個分析模型。這個分析模型是針對挖掘演算法建立的。建立一個真正適合挖掘演算法的分析模型是資料採礦成功的關鍵.
3. 資料採礦
對所得到的經過轉換的資料進行挖掘。除了完好從選擇合適的挖掘演算法外,其餘一切工作都能自己主動地完畢。
4. 結果分析
解釋並評估結果.其使用的分析方法一般應作資料採礦操作而定,一般會用到可視化技術。
5. 知識的同化
將分析所得到的知識整合到商務資訊系統的組織圖中去。
Q7:資料倉儲與資料採礦的關係是如何的?
資料倉儲和資料採礦的關係資料倉儲和資料採礦都是資料倉儲系統的重要組成部分, 它們既有聯絡, 又有差別。
聯絡是:
(1) 資料倉儲為資料採礦提供了更好的、更廣泛的資料來源。
(2) 資料倉儲為資料採礦提供了新的支援平台。
(3) 資料倉儲為更好地使用資料採礦這個工具提供了方便。
(4) 資料採礦為資料倉儲提供了更好的決策支援。
(5) 資料採礦對資料倉儲的資料群組織提出了更高的要求。
(6) 資料採礦還為資料倉儲提供了廣泛的支援人員。
差別是:
(1) 資料倉儲是一種資料存放區和資料群組織技術, 提供資料來源。
(2) 資料採礦是一種資料分析技術, 可針對資料倉儲中的資料進行分析。
Q8:資料倉儲與資料採礦在一些商業領域中的應用及現實意義
1)商品銷售。商業部門把資料視作一種競爭性的財富可能比不論什麼其它部門顯得更為重要,為此須要把大型市場營銷資料庫演變成一個資料採礦系統。科拉福特(Kraft)食品公司(KGF)是應用市場營銷資料庫的公司之中的一個,該公司搜集了購買它商品的3000萬個使用者的名單,這是(KGF)通過各種促銷手段得到的。KGF定期向這些使用者發送名牌產品的優惠券,介紹新產品的效能和使用方式。該公司體會到瞭解自己商品的使用者越多,則購買和使用這些商品的機會也就越多,公司的營業狀況也就越好。
2)製造。很多公司不僅決策支援系統用於支援行銷活動,並且,由於市場競爭越演越烈,這些公司已使用決策支援系統來監視製造過程,有製造商聲稱已經指示它的各個辦事機構,在三年內把製造成本每年減少25%。不言而喻,該製造商常常收集各組件供應商的情況。由於,它們也必須遵循該製造商減少成本的戰略。為了對付來自各方的挑戰,該製造商已擁有一套“成本”決策支援系統,能夠監視各供應商提供的零組件成本,以實現所制定的價格目標,這樣的應用須要收集有關各廠商連續一年來的產品成本資訊,以便確定這樣的組織方式是否能滿足原先制定的有關降價的戰略目標。
3)金融服務/信用卡。通用汽車公司(General Motors)已經採用信用卡——GM卡,在該公司的資料庫中已擁有1200萬個持有信用卡的客戶。公司通過觀察,能夠瞭解他們正在駕駛什麼樣的汽車,下一步計劃購買什麼樣的汽車及他們喜歡哪一類車輛。譬如說,一個持有信用卡的客戶表示對一種載貨卡車感興趣,公司就能夠向卡車部門發出一個電子郵件,並把該客戶的資訊告訴有關部門。
4)遠程通訊。很多遠程通訊的大公司近來突然發現它們面臨極大的競爭壓力,這在幾年前是不存在的。在過去,業務上並不須要他們密切注視市場動向,由於顧客的挑選餘地有限,可是這樣的情況近來發生非常大變化。各公司當前都在積極收集大量的顧客資訊,向他們現有的客戶提供新的服務,開拓新的商務專案,以擴大他們的市場規模。從這些新的服務中,公司在短期內就能夠取得更大的效益。