程學旗:關於中國大資料生態系統的基礎問題思考

來源:互聯網
上載者:User

「中關村大資料產業聯盟」推出「大資料100分」論壇,晚上9點開始,于「中關村大資料產業聯盟」微信群進行時長100分鐘的交流、探討。

白碩:擔任今天主講的是中科院計算所程學旗研究員,大家歡迎!

白碩:現任中國科學院計算技術研究所副總工、研究員、博士生導師、網路科學與技術重點實驗室主任。

作為中科院計算所互聯網高性能軟體與演算法理論、網路搜索、網路資訊安全方向的團隊負責人和學科帶頭人,帶領團隊從事國家網路空間安全保障、互聯網高性能軟體以及網路搜索與挖掘基礎理論與演算法的研究以及相關應用系統的研發, 先後主持並完成了十多項國家資訊安全重大專項、國家重大基礎研究計畫(973)、國家高技術研究計畫(863)以及中國科學院知識創新工程等重大任務。

程學旗:首先,謝謝白老師主持,謝謝國棟為大家創造了一個很好的環境,我們可以在此頭腦風暴、分享觀點。 其次,前天和昨天白老師和熊輝教授的引導性發言立意新穎、觀點鮮明,讓我受益匪淺啊。

程學旗:上周國棟讓我從國內學術科研界的視角來分享一下我們的思考。 從能力上來講確實有點勉為其難,只能抛磚引玉。

程學旗:大家知道,自從我們2012年開始組織香山科學會議大資料論壇、組建中國電腦學會大資料專家委員會以來,一直努力在宣導和呼籲聯合各方力量來推動中國大資料產學研良性生態環境建設, 今天群裡面的很多大腕都是直接的宣導者和參與者。

程學旗:一年多來,通過組織中國大資料技術大會、CCF大資料學術會議以及各類大大小小的應用峰會與學術論壇,結合我們科學院網路資料科學與技術重點實驗室所承擔的與大資料相關的重大基礎課題研究以及與情報分析、 互聯網資料分析相關的應用開發實踐,我談談自己的一些思考。

程學旗:今天引導性討論的內容可以包括三大塊,包括:對大資料的再認識、引擎平臺系統支撐下的大資料分析技術、建立大資料產學研生態環境的基礎性問題思考。

白碩:引擎平臺系統,單數還是複數?

程學旗:應該是單數,呵呵

@雷濤:程所給大家搭了大平臺和產業話筒。

程學旗:1、關於大資料的再認識。

大資料是一個寬泛的概念,見仁見智。 關於大資料的概念,當前比較普遍使用的定義都與維琪百科中的描述類似:「大資料,指的是所涉及的資料量規模巨大到無法透過目前主流軟體工具,在合理時間內達到擷取、管理、處理、並整理成為説明企業經營決策更積極目的的資訊」。 而這類定義的一個明顯的局限是僅僅從大資料的電腦處理視角給出的關於大資料的一個特點描述。

我們知道,對一門學科的認識,往往是從分類開始的。 就像達爾文提出進化論,原始的動機就是將從全世界觀察到的動物和植物進行劃分,形成體系。 在分類體系上進行提煉,最終形成了一個全新的世界觀和認識論。 我們現在所關注的網路大資料、金融大資料、科學大資料等相關領域的問題,正像歐洲文藝復興開始的的時候那樣,從不同領域觀察現象,挖掘價值,而最終我們可能能夠發現本質,形成全新的「資料認識論」,從而產生本質性的價值效應。

我個人認為,「大資料」更多的體現的是一個認知和思維,它與錢學森先生提倡的「大成智慧學」的要義非常接近。 錢老將「大成智慧」翻譯成「WisdominCyberspace」,強調「必集大成,才能得智慧」。 大資料從內涵來看的四個V的特性,體現出來的是大量的「零金碎玉」,相互之間還有關聯性和作用力,但是局部看都非常零散、價值不明顯。 所以有了資料,不等於就有價值、出智慧,出智慧的關鍵在「集」。 大資料中包括的全部事實、經驗、資訊都是「集」的物件和內容。 採集到的原始資料往往是些沒有什麼邏輯,不一定能直接用現在掌握的科學技術解釋,需要集成融合各個側面的資料,才能挖掘出前人未知的大價值。 每一種資料來源都有一定的局限性和片面性,事物的本質和規律隱藏在各種原始資料的相互關聯之中。 只有融合、集成各方面的原始資料,才能反映事物的全貌。 開展大資料研究和應用,因此,大資料不僅僅是一類資源、一類工具,而是一種戰略、認知和文化,要大力推廣和樹立「資料方法論」、「資料價值觀」。

當然,我們既要抬頭看路,更要腳踏實地。 因此,在大資料概念滿天飛的時候,我們既要抓住時機,挖掘價值,還要思考本質,不在混亂的時候迷失方向

白碩:智慧變價值,還有個從「集」到「散」的環節吧?

程學旗:對,「集」產生智慧,「智慧」分散支撐更廣泛的「價值」

@大潘:對資料的思路,最終還是要靠系統來實現

@wuyj:有沒有從量增到質變?

程學旗:@wuyj所以說從量增到質變、從「還原論」到「系統論」,類似的道理

程學旗:從業界來看,當前大資料系統有三個明顯的特點與我們2013年底發佈的十大趨勢相關

【1】大資料的高效深度分析需要專用化的系統

在應用資料快速增長的背景下,為了降低成本獲得更好的能效,大資料系統需要逐漸擺脫傳統的通用技術體系,趨向專用化的架構和處理技術。 這方面,國內百度、阿裡巴巴和騰訊三大互聯網巨頭做出了嘗試並取得了很好的效果。 眾所周知,百度的大資料典型應用是中文搜索,阿裡巴巴的大資料典型應用是基於交易日誌分析的資料服務,騰訊的大資料典型應用是圖片資料存儲和基於使用者行為的廣告即時推薦。 百度去年底成立專門的大資料部門,旨在深度挖掘大資料的價值。 阿裡巴巴已將不同營業單位的大資料技術整合在一起為數據產品提供統一的服務。 騰訊的資料平臺部正在將全公司的資料納入統一管理平臺。 阿裡巴巴在技術上與開源社區結合得最為緊密;騰訊大資料目前正在向開源技術靠攏;百度在技術層面偏好自行研發,包括軟硬體定制化方案也是最先投入實用。 技術上,他們的共同之處是,不再依賴傳統的IOE,而基於開源系統(如Hadoop等)開發面向典型應用的大規模、高通量、低成本、強擴展的專用化系統。

【2】大資料處理架構多樣化模式並存

當前,克隆了Google的GFS和MapReduce的ApacheHadoop自2008年以來逐漸被互聯網企業所廣泛接納,並成為大資料處理領域的事實標準。 但2013年出現的Spark作為一匹黑馬終結了這一神話,大資料技術不再一家獨大。 由於應用不同導致Hadoop一套軟體系統不可能滿足所有需求,在全面相容Hadoop的基礎上,Spark通過更多的利用記憶體處理大幅提高系統性能。 此外,Scribe、Flume、Kafka、Storm、Drill、Impala、TEZ/Stinger、Presto、Spark/Shark等的出現並不是取代Hadoop,而是擴大了大資料技術的生態環境, 促使生態環境向良性化和完整化發展。 今後在非易失存儲層面、網路通信層面、易失存儲層面和計算框架層面還會出現更多、更好和更專用化的軟體系統。

【3】即時計算逐步受到業界關注

Google于2010年推出了Dremel,引領業界向即時計算邁進。 即時計算是針對MapReduce這種批量計算的性能問題提出的,可分為流式計算和互動式分析計算兩種模式。 在大資料背景下,流式計算源于伺服器日誌的即時採集,如Facebook開源的Scribe是分散式日誌收集系統,ApacheFlume是類似的系統。 ApacheKafka是高吞吐率的分散式消息系統,特點是高通量和容錯。 Storm是容錯的分散式即時計算系統,可以可靠的處理流式資料並進行即時處理,單機性能可達到百萬記錄每秒。 Storm可集成ApacheKafka作為其佇列系統。 作為批量計算的補充,互動式分析計算的目標是將PB級資料的處理時間縮短到秒級。 ApacheDrill是開源的Dremel實現,雖已有應用但尚不成熟。 由Cloudera主導的Impala也參照Dremel實現,同時還參考了MPP的設計思想,目前已經接近實用階段。 Hortonworks主導開發了TEZ/Stinger,TEZ是運行在YARN(Hadoop2.0的資源管理框架)上的DAG計算框架,而Stinger是下一代的Hive。 2013年底,由Facebook開源的Presto分散式SQL查詢引擎可對250PB以上的資料進行互動式分析,比Hive的性能高出10倍。 類似的Shark是Spark上的SQL執行引擎,得益于Shark的列存儲和Spark的記憶體處理等特性,Shark號稱可以比Hive的性能提高100倍。

白碩:即時計算、流式資料、複雜事件處理

程學旗:這些過於技術細節了。 大資料系統的三個特點就是「引擎專用化」、「平臺多樣化」、「計算即時化」

@大潘:大資料處理技術還不會相對穩定,最近幾年一定還會有多樣化的技術和系統出現。

白碩:未進入穩週期性另一個說法就是處在機遇期

@有良心和良知的人:演算法是問題嗎?

程學旗:是的,這就是我們所講的「onesizefitsall」在大資料時代是一個困境,同時也是一個絕好的機遇。

程學旗:在這個時機,開源促進了大資料的步伐,大資料也將改變開源的模式

程學旗:脫離大資料支撐系統的演算法,將變成純粹的「toy」遊戲。 當然,演算法的基礎理論除外

@大潘:大資料時代的出現,促進了IT的價值向「資料」聚集,讓「系統」的價值被分走了一些。 「系統的開源」將比「資料的開放」更容易。 開源與大資料的密切關聯是必然的。

(責任編輯:蒙遺善)

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.