大資料將演變成重要的企業資產
在我看來,大資料的概念可以從以下兩個方面解釋:
1. 從技術的角度看,大資料是指資料量大且複雜到無法通過傳統資料庫技術進行治理和價值發掘。 在這種需求下,各種NoSQL、NewSQL、開源技術或者商業平臺不斷出現並進化。
2. 從商業的角度來看,大資料將衍生出很多新的商業模式。 其一、只要技術足夠,企業可以整合內部和外部大資料(例如社交資料、App資料),更好地優化自身業務,實現對傳統商業模式的超越。 其二、只要技術足夠,企業將收集並治理那些不曾有能力收集並治理的大資料,再發掘出巨大的商業價值。 大資料,將演變成重要的企業資產。
我認為當前熱門的大資料技術主要包括以下內容:
1. 用於大資料存儲的Hadoop HDFS,以及衍生的資料庫HBase;
2. 批次處理大資料項目目有Hadoop MR,它最新版本是YARN。 衍生專案有資料倉儲Hive和機器學習Mahout;
3. 即時處理大資料的專案有:Spark以及衍生的資料倉儲Shark,Cloudera Impala;
4. 用於流計算的專案有Apache Storm。
5. 商業大資料產品有一體機例如PureData、Exadata、Hana; MPP DW例如Vertica、Aster Data、GP; MPP DM例如 Yonghong DM。
未來比較看好即時大資料技術的原因是即時大資料技術能夠讓企業對大資料進行探索式和互動式分析,相比于之前沒有靈活性和動態性的批次處理大資料技術而言,它將大大提升發掘大資料價值的效率和可能性。
我覺得國內大資料發展勢頭不錯,但以下三個方面仍需改進:
1. 商業大資料產品或者技術至少應該占1/2,而不應該逢大資料就聊開源。 我們看到在美國很多大資料的商業公司越來越強大,例如Cloudera、Hortonworks、MapR、1010Data。 但國內企業要麼大資料搞不起來,要麼技術比較強的就自己搗騰開源,這不利於資源整合,優勢互補。
2. 兩個極端。 國內大資料項目目是啞鈴型,要麼上超貴的一體機,要麼上開源的大資料項目目。 實際上,在上大資料項目目的時候,可以選取性價比比較好的商業產品或者商務服務,而不要走兩個極端。
3. 目前的主流大資料產品和技術都在美國。 作為21世紀最重要的國家之一,中國應該有自己的主流大資料產品和技術,而不僅僅是搬磚頭或者盲目跟從。 希望能與各位同仁一起努力,在即時大資料領域做點工作。