hold住大資料!解析EMC Isilon集群存儲
來源:互聯網
上載者:User
在英特爾的推動下,IT系統通信頻寬和計算能力遵循摩爾法則不斷創下歷史新高,保持了每12-18個月翻一番的發展速度。 與此同時,IDC最新「數位宇宙」研究預測:資料增長速度將超過摩爾定律,2011年將達到1.8ZB;未來10年,企業將管理50倍于現在的資料量,檔量將增加75倍。 在數位宇宙飛速膨脹的背景下,「大資料」的概念也應運而生。
詳解Big Data
其實,大資料和雲計算是兩個相生相伴的概念,儘管業界暫時並沒有關於大資料的官方定義,但其實,各廠商對大資料的理解已經達成共識。
EMC資訊基礎設施產品部總監兼首席運營官Pat Gelsinger認為:大資料應該包括三個要素,首先,大資料是大型的資料集,一般在10TB規模左右,有時候多個資料集集合在一起會形成PB集資料量。 其次,這些資料集往往來自于不同的應用和資料來源,要求系統能夠把半結構化、非結構化和結構化的資料很好地融合起來;最後,大資料還具有即時、可反覆運算的特點。
IDC全球存儲及大資料項目目副總裁Benjamin Woo則提出,大資料有四個基本要素,Volume、Variety、Velocity、value。 首先,資料在容量上是海量的;其次,大資料是由大量的人提供的龐大資料集,具備多樣性特徵;此外,無論是企業還是遍佈世界各地的個人使用者提供資料,這些資料的價值是非常高的,此外,從系統要求來說,希望獲得資料的速度是非常快速的。 所以用四個V來概括大資料特點。
此外,EMC對大資料和雲之間的關係做了更為深入的詮釋:大資料和雲是兩個不同的概念,但兩者之間有很多交集。 支撐大資料以及雲計算的底層原則是一樣的,即規模化、自動化、資源配置、自愈性,因此實際上大資料和雲之間存在很多合力的地方。
「當我們打造雲設施的時候,就會想雲設施上應該跑什麼樣的應用,大資料就是在雲上跑的、非常典型的應用。 例如儘管電子郵件也是雲上的應用之一,但也可以脫離雲架構,但是大資料應用必須架構在雲設施上。 這就是兩者的關係--大資料離不開雲。 」 Pat Gelsinger如是說。
傳統存儲的瓶頸
如今,大資料的概念已經日益清晰,但解決大資料的存儲問題仍然是擺在每個使用者面前的一道難題。 不僅如此,整個IT領域技術飛速發展,很多20年以前的新技術、新架構,如今面臨淘汰甚至已經消失在技術發展的浩瀚長河中;而今天的很多新技術,20年後還將面臨同樣的命運,存儲領域的技術更迭相比其他任何一個領域都表現的格外明顯。
存儲領域的關鍵技術SAN和NAS架構如今也已經有了近20年發展歷史,並從十年前開始取代DAS成為企業存儲的主流標準架構。 然而,SAN和NAS平臺本質上不過是對 DAS 的改進,並未突破傳統存儲技術的瓶頸。 傳統存儲架構依然存在根本性的體系結構缺陷:
首先,傳統的存儲架構是靜態的,其設計在可擴充性方面先天存在著不足,在進行擴展時,往往只能磁片數量擴展,背板、記憶體和處理器資源卻無法隨之擴展。 企業若想要滿足不斷增長的容量和性能要求,就不得不花費大量成本,且面臨的資料風險也不斷增加。 最後的結果是,使用者需要管理越來越複雜的存儲,但所需的組織和人員配備卻不能持續增長。
卷是各種存儲技術的最基本部分,為使用者的前端應用提供資料服務,從存儲卷的應用模式上看,已經體現出需要新的存儲模式的最明顯徵兆。 在一個理想的「雲」的系統內容中,卷應該是靈活自由的,我們很難找到將資料限制到特定位置的理由。 在足夠的安全性和可靠性前提下,個人和應用程式應該能夠從任何地理位置輕鬆訪問檔和資料夾,就像資料在本地一樣,並且,隨著應用規模的增長,所對應的存儲卷也應該無縫的隨需增長。
然而事實的情況是,存儲卷並不能在各種並不能完全自由的在設備間隨意遷移、且存儲卷的擴展與收縮顯然也並不如我們想像的靈活。 當存儲卷受到可靠性問題、技術限制或性能等多方面限制時,最終給使用者帶來的問題就是效率低下的情況。 這些固定的資源集要充分發揮全部潛力,
此外,傳統存儲環境遭遇的另一個重要難題是浪費;許多存儲供應商認為使用者環境的存儲系統中,多達50%的資源未得到充分利用。 當然這一點有利於存儲供應商的收益,但對使用者來說,將導致電力、冷卻和管理方面的浪費。
先天存在的瓶頸使得傳統存儲在面臨大資料難題時更加捉襟見肘。
Isilon應對大資料
Isilon是集群存儲領域的老牌廠商,儘管該領域內曾經擁有多家強勁有力的競爭者,但隨著戴爾收購Exanet,LSI收購ONstor,惠普收購Ibrix、HDS收購BlueArc等一系列收購案的發生, 如今集群存儲領域已經鮮有獨立廠商存在,集群存儲市場已經成為綜合型存儲方案供應商角逐的天下。 而EMC花費22.5美金收購Isilon的舉措,也被解讀為EMC急於利用Isilon在「大資料(Big Data)時代」鞏固自己的領先地位。
Isilon基於集群存儲系統,其核心技術在於OneFS檔案系統,硬體平臺採用了基於英特爾X86標準化元件。 OneFS(請參見圖 1)將三個傳統的存儲體系結構層(檔案系統、卷管理器和 RAID)組合為一個統一的軟體層,從而創建一個跨越存儲系統中所有節點的單一智慧檔案系統。 英特爾X86平臺的標準化元件則為OneFS提供了完美的硬體基礎,依託于英特爾標準化平臺的強勁性能、優異能耗比和突出的性價比,OneFS在這些標準化硬體上發揮其強大的存儲管理功能。
OneFS檔案系統專為解決大資料存儲難題而設計。 一個Isilon 群集由多個基於X86平臺的存儲「節點」組成,其中包含記憶體、CPU、網路、NVRAM、Infiniband 和存儲介質。 在OneFS檔案系統支援下,Isilon 群集可以從三個節點,橫向擴展到多達144個節點。 此外,Isilon還為大資料提供最大單一檔案系統,在單一檔案系統和單個卷中可擴展至超過15PB。 添加到群集的每個節點可以增加總的磁片、緩存、CPU 和網路容量。 由於總容量增加,144個節點的群集可以訪問高達13.8 TB的全域一致共用緩存。 此外,容量和性能均在單一存儲系統、單一檔案系統和單一卷中提供,系統的複雜性和存儲管理員的管理時間不會隨著系統的擴展而增加。
今年,EMC針對Isilon產品線進行了新一輪升級。 新的EMC Isilon S200和X200產品均採用了英特爾的Westmere和Nehalem處理器,其高端S200系統可提供超過兩倍的檔輸送量。 S200將替代先前的IQ 5400S,S200將替代現有的IQ 7200X。 而7200X的近線存儲版本72NL和36NL仍將保留在Isilon的產品群組中。 不過,據估計,即將推出的200NL將作為現有硬體的更新踏入近線產品領域。
S200具有2個4核Westmere處理器可提供140萬的NFS IOPS,單個檔案系統具有85GB/s的輸送量。 而先前的5400S僅可提供600000 NFS IOPS、其輸送量約為45GB/s。 中端的X200每個節點有1個Nehalem處理器和48GB的最大記憶體,能容納24TB的資料,其中包括12塊2TB、3.5英寸SATA硬碟。 縱向可擴展至5.2PB,可能提供309312 IOPS,具有35.7GB/s的輸送量,6.9TB的全域緩存。 除了對傳統磁片的支援,X200還支援固態硬碟。
X86平臺在集群存儲的應用
Isilon是EMC大資料戰略的關鍵佈局之一,通過獨特的分散式檔案系統和高效的硬體基礎滿足大資料的存儲需求。 在大資料需求背景下,集群化架構已經從計算處理應用拓展到了資料存儲領域,如今,存儲領域的多數高端系統已經從傳統的Scale up模式轉向了Scale out架構,基於Scale out架構的分散式平行計算特徵,Intel X86架構也在集群存儲架構中發揮了重要作用。
總結起來,英特爾在存儲領域的策略可被概括為標準化、高集成與低成本三個要素。
英特爾在標準化方面的推進力度可說是不遺餘力,英特爾存儲首席技術官Mike McGrath就曾在採訪中表示:英特爾遵循的是開放的原則和開放的技術,封閉的技術與產品不一定是使用者必須的選擇。 存儲走向集成和融合的趨勢不可阻擋,而這個過程中標準化將是關鍵。 從長遠和使用者成本的角度來看,存儲行業是最終需要走向開放的。
在集群存儲的系統架構中,採用標準化的硬體平臺有助於降低整體的系統成本,説明使用者更容易、更快的採用業界最新技術,同時提供了最大程度的相容特性,並為日後的擴展與升級打下了良好基礎。
在下一代(預計2012年發佈)的英特爾伺服器平臺Romley-EP上,英特爾將在主機板上集成10Gb乙太網交換技術,包括Sandy Bridge-EP伺服器處理器(未來的命名為至強E5)及Patsburg晶片組上, 英特爾將在處理器晶片中集成了RAID加速功能,並將在Patsburg晶片組上集成6Gb/s SAS介面。 這幾項重要的存儲功能的加入,使得Romley平臺成為一個高集成度的處理器平臺,大大簡化存儲系統的體系架構和設計門檻,同時推動存儲融合進入一個全新的階段。
此外,基於英特爾得天獨厚的標準化和規模化優勢,X86節點往往在性能優異的同時,提供了較高的計算密度、較低的成本和功耗、以及簡單靈活的管理, 使得基於X86平臺的集群存儲在應對大資料等規模化存儲需求時具備不可比擬的成本優勢。