大資料給我們的九個「教訓」

來源:互聯網
上載者:User

昨天和今天我參加了俄亥俄州立大學的「大資料未來研討會」。 俄亥俄州正在與IBM公司合作在當地創建一個大資料中心,逐漸成為該領域的一個重要學術力量。 本次研討會彙聚了來自全國各地的專家和一名來自英國的專家,就該領域當前的成就、趨勢和話題進行一次卓有成效的探討。 很遺憾我沒能參加今天下午的展示會,但大家可以在會議官網和即將出版的《資訊社會的法律和政策》雜誌(AJournalofLawandPolicyfortheInformationSociety)上瞭解更多詳情。

大資料和開放資料不是一回事,但他們有著密切的聯繫(正如我在主題發言稿「未來的大資料將會開放到什麼程度?」 上寫到的)。 我們正在關注的大資料一些趨勢和話題與開放資料也有關系。 按照這樣的脈絡,就出爐了這篇我在去哥倫布的路上學到的《瞭解大資料的九件事》。 在研討會的官網上可以看到我用黑體標注的人們的名字。

為大資料的激烈反應做好準備。 很多演講者提到了「大資料過分渲染宣傳」的話題,認為大資料被討論得如此熱烈,以至於我們現在可以進入一個反應性的迴圈。 MikeNelson對他在公開場合看到的逐漸出現的「垃圾資料」提出了責難,甚至建議我們應該重新命名大資料,它可以有一個「大兄弟」–就像很多人一樣。 他建議改名為:BFFMUDD,是大(Big)、肥(Fat)、快(Fast)、亂(Messy)、非結構化(Unstructured)、分散式資料(DistributedData)的縮寫。

意識到「大資料的狂妄自大」。 好幾位演講者引用了一份新報告,報告顯示,「Google流感趨勢」–大資料預測價值的首批大範例之一–被證明非常不准確。 顯然,Google可能自作聰明地以一種錯誤的方式調整了其演算法。 不管什麼樣的錯誤,這都是個教訓,表明如果不著眼于更廣闊的圖景,而只是試圖通過碾碎資料來發現真相,通常情況下無法獲得預期效果。

資料不能代替判斷。 資料,尤其大資料是可以説明人類做出決策的工具,但不能起到代替的作用。 RayHarishankar是這樣說的:「資料加上分析是資訊,資訊加上語境可以提供洞察力,洞察力必定能導向正確的行動,正確的行動則帶來提升價值的結果」。

相關關係不能強過理論。 一些大資料的宣導者認為大資料幾乎讓理論變得多餘:他們說,有了足夠的資料,即使沒有理論說明其原因,我們也可以發現很多重要和有益的模式和趨勢。 確實,簡單的相關關係在一定程度上就可以驅動精確的預測。 但即便是具備預測分析的能力,也並不意味著你就能真正地理解你正在研習的系統是如何運行的。 EytanAdar 建議我們審視大資料範圍從預測性到解釋性的所有相關努力,並且更多地關注如何理解我們所看到的東西,而不是僅僅關注可預測未來的模式。

大資料正在-冒著風險–追蹤一個「移動」 社會。 在全球範圍,行動裝置都已經成為人類的首選線上連接工具。 FarnamJahanian指出到2015年全球行動裝置的數量將是人口數量的兩倍,所有的設備都可以發送位置資訊和其它資料給能夠收集這些資料的公司。 這將成為未來社會大資料的主要來源之一。 但KateCrawford?指出了這裡的隱私風險:由於人類移動行為模式的獨特性,你可以僅用3-4個手機生成的資料點就能識別一個人。

大資料能説明–或者損害城市的民主體制。 正如HarveyMiller所說,通過手機資料、遠端環境感應器、鐳射生成的航空地圖和更多工具來追蹤城市活動的能力,可以給我們創造擁有更高代謝功能的超級協調城市。 (遺憾的是,我不得不在MichaelBatty關於城市分析的主題演講之前離開,不過他在個人網站上提供了演講內容)但是,KateCrawford在這裡再次提出了警告。 如果我們不小心,城市資料收集就會不對稱地説明富人而傷害窮人。 比如,波士頓的 StreetBumpAPP應用通過追蹤智慧手機的擺動狀態來收集坑窪裡的資料,用志願者的資料來反映一條道路的顛簸不平。 但大多數智慧手機的擁有者都屬於生活富裕的人群,以至於最初是在更富有的地區監測和修復坑窪–這是StreetBump目前正在致力於修正的難題。 在相反的另一面,「預測監控」正在被用於將員警管制實施于預測將會有高犯罪率的地區,這將導致歧視性的執法。

隱私仍然事關要緊。 忘掉那些宣稱公眾,尤其是年輕人已經放棄隱私的報告吧。 我們仍然關心隱私問題,只是不知道該怎麼做。 這裡有兩個考慮因素:我們想知道政府機構或資料跟蹤公司收集到了哪些關於我們的資料資訊,以及如果我們不喜歡,則想讓他們停止收集。 關於如何解決這些考慮因素還不是很清晰。 會上的一些發言者建議採用簡單的解決方案:讓政府和公司對它們正在收集的資料更公開透明,這是一些人稱之為「互相確認的公開」的方法。 但是一個長期的透明度宣導者GaryBass說,這個建議的解決方案「不是真實的世界。 在過去的30年裡,我拼命地鬥爭讓資料變得可獲取,而政府和公司則拼命地讓資料不可獲取...... 這是一場曠日持久的鬥爭」。 正如其他人所說,這裡的風險在於我們可能增強了資料收集者和被收集者之間的力量不對稱性。

大資料應當展現資料之美。 資料視覺化方面的迅速進步正在創造一些美輪美奐的效果。 比如,看一看這部「體驗自行車人流」的視頻,逐漸解析倫敦自行車交通的資料,展示俄亥俄州超級電腦中心最清晰的模式和部分已經完成的視覺化作品。 類似這樣的資料視覺化並不僅僅關乎美學,而是與理解息息相關。 IBM公司的一位資料視覺化專家 AngelaShen-Hsieh談到人們需要使資料更加「適合人類消費」,以及關注從電腦螢幕到人腦的資訊傳遞旅程中的「最後18英寸」。

大資料將(很有可能)產生大價值。 拋開所有的警告不管,大資料中有很多社會價值和經濟價值可以發掘。 麥肯錫幾年前一份具有里程碑意義的大資料包告預測它將撬動數萬億美元的經濟價值。 這項研究的聯合作者,微軟公司的AngelaByers?今天說到,也許仍需要5-10年時間才能產生這樣的價值,部分原因是我們仍然面臨一個重要的技能鴻溝:即可獲得的資料數量和清楚如何利用這些資料的人的數量之間存在的差距。 但是經濟價值正在逐步顯現,並且以某種令人驚異的方式呈現。 JohanBollen和他的團隊成員運用Twitter上的大資料情感分析來預測股票市場:他們計算Twitter上的「鎮靜」情緒來預測道鐘斯指數三天后的收盤點位。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.