毋庸置疑,大資料時代已經來了。 那麼,我們如何去應對這種局面呢? 下面,我們聽聽擁有此方面經驗的專家是如何說的吧。
首先我們要知道,在成百上千TB的資訊中,我們該如何充分利用大資料。 這完全取決於個人的需求和偏好。 Interclick廣告服務公司找到了一種在提供接近即時資料分析的同時,能提供更高效的解決方案。 哈佛醫學院也瞭解到,在對病人數量和多年保持不變的資料研究的情況下,資料也會明顯增長。 互聯網流量監測機構comSCore,擁有12年的利用列存儲資料庫壓縮資料的豐富經驗,事實上,它採用了排序技術來優化壓縮、減少處理需求。
目前,包括雅虎、Facebook、Twitter、NetFlix和eHarmony(美國線上約會網站)都認為,Hadoop是一個理想化的低成本處理 非結構化資料平臺。 它不僅能滿足互聯網巨頭需要,也能滿足包括摩根大通銀行和其他主流的傳統企業的需求。 資料供應商InfoChimps同時發現,隨著越來越多的附加和輔助應用的提供,Hadoop將是提供部署支援的快速成熟方案。
大資料時代下的應用
當然,並非所有的大資料部署都是根據總規模來衡量。 比如Linkshare只保留了幾個月但每天都需要載入和快速分析多達數十GB的資料,因此對於每天的這些資料規模來說它是一個比較大規模的部署。 除此之外,我們還需要注意資料倉儲擴充性的六個維度。 只有這樣,我們才可以制定一個較為準確的方案,從而滿足最為苛刻的測試需求,並獲得技術投資滿足未來需要。
一、快速查詢確保高效和及時
大規模並行處理平臺、列存儲資料庫、資料庫內處理技術和記憶體計算技術,都可以大幅降低資料查詢時間,從數天、數小時縮減到幾分鐘甚至幾秒。 但這並不夠。 紐約廣告公司Interclick發現,快速分析帶來的最主要好處是高效。 快速回應能爭取到更多時間進行更多、更深入的查詢工作。 第二個好處則是,可以獲得幾近即時分析的結果,據此分析有助於提高決策反應水準和準確率。
Interclick所採用的大資料分析技術
通過快速回應,Interclick能夠在幾個小時甚至數分鐘內對隨意瀏覽者的行為進行細分。 它能夠對訪問旅遊網站、預訂酒店網站等的網名行為資訊,發送給相應的航空公司、連鎖酒店、汽車租賃公司等。 Interclick採用的是ParAccel列存儲資料庫部署,記憶體集群可以容納3.2TB容量的資料。
二、衡量資料增長時深知何為貴
通過對長達20年的醫療記錄、研究各種藥物的療效和風險,哈佛醫學院吸取到了這樣一種教訓--在規劃資料倉儲投資時,不僅僅需要解諸如客戶、記錄和交易數量等簡單問題。 雖然病人數量和時限仍然較為穩定,但各種醫療記錄卻不斷豐富起來,因為湧現出了很多新的健康監測技術指標。 因此,事先瞭解所有的動態需求至關重要。
哈佛醫學院
三、資料壓縮和削減存儲成本
更好的資料壓縮可以節省每TB硬體成本。 列存儲資料庫,比惠普的Vertica、Infobright、ParAccel和Sybase IQ,可以實現30:1或者40:1的壓縮比。 而行存儲資料庫,比如EMC Greenplum、IBM Netezza和Teradata,平均4:1的壓縮比。 這是因為柱狀資料可以保持一致,包含郵編、採購訂單號碼等多種資料。 而行狀資料,比如與客戶相關的屬性組合--名稱、位址、郵編、採購訂單號等等,則不具有這種優勢。 Aster Data和甲骨文資料庫可以提供混合行/列存儲功能。 甲骨文的Hybrid Columnar Compression可以提供10:1的壓縮比。
資料壓縮
壓縮比率不同很大程度上取決於資料本身,而且列存儲並不總是最好的選擇。 如果在資料查詢的時候需要調用很大屬性,行存儲方案可能會表現出更好的性能。 事實上,行存儲資料庫經常被企業應用在處理混合查詢的資料倉儲中,而列存儲資料庫更多的是集中在海量資料查詢中。
四、分類壓縮、減少處理時間
類似連續性的列資料有利於壓縮一樣,我們也可以通過資料載入之前進行分類從而提高壓縮比。 在將資料裝載進Sybase IQ至 強,comSCore使用Syncsort DMExpress軟體對資料進行分類。 該公司的CTO Michael Brown(圖示)表示,它可以將10位元組的 資料壓縮成3、4個位元組,而通過分類後的10個位元組資料可被壓縮成1個位元組。 「這將給我們存儲海量資料提供了另外一種方式 。 」
123下一頁