Time of Update: 2015-03-12
標籤:NoSQL資料庫都被貼上不同用途的標籤,如MongoDB和CouchDB都是面向文檔的資料庫,但這並不意味著它們可以象JSON(JavaScript Object
Time of Update: 2015-06-06
標籤:機器學習中梯度下降(Gradient Descent, GD)演算法只需要計算損失函數的一階導數,計算代價小,非常適合訓練資料非常大的應用。梯度下降法的物理意義很好理解,就是沿著當前點的梯度方向進行線搜尋,找到下一個迭代點。但是,為什麼有會派生出
Time of Update: 2015-04-10
標籤:項目地址 : https://github.com/Huangtuzhi/AlibabaRecommand AlibabaRecommand Alibaba 2015 mobile recommending algorithm competition. 比賽介紹 比賽通過對使用者在移動終端上一個月的行為資料進行分析,為後一天的使用者購買行為作出預測,進行推薦。 目錄結構 ├── LICENSE #許可證└── README.md
Time of Update: 2015-07-20
標籤:1 概述HBase是一個分布式的、面向列的資料庫,它和一般關係型資料庫的最大區別是:HBase很適合於儲存非結構化的資料,還有就是它基於列的而不是基於行的模式。既然HBase是採用KeyValue的列儲存,那Rowkey就是KeyValue的Key了,表示唯一一行。Rowkey也是一段二進位碼流,最大長度為64KB,內容可以由使用的使用者自訂。資料載入時,一般也是根據Rowkey的二進位序由小到大進行的。HBase是根據Rowkey來進行檢索的,系統通過找到某個Rowkey (或者某個
Time of Update: 2015-07-19
標籤:一、基礎概念詳細介紹1、引言你是否遇到過兩個(多個)系統間需要通過定時任務來同步某些資料?你是否在為異構系統的不同進程間相互調用、通訊的問題而苦惱、掙紮?如果是,那麼恭喜你,Message Service讓你可以很輕鬆地解決這些問題。Message
Time of Update: 2015-07-19
標籤:一、MQ(Message Queue)即 訊息佇列,一般用於應用系統解耦、訊息非同步分發,能夠提高系統輸送量。MQ的產品有很多,有開源的,也有閉源,比如ZeroMQ、RabbitMQ、 ActiveMQ、Kafka/Jafka、Kestrel、Beanstalkd、HornetQ、Apache Qpid、Sparrow、Starling、Amazon SQS、MSMQ等,甚至Redis也可以用來構造訊息佇列。至於如何取捨,取決於你的需求。
Time of Update: 2015-05-03
標籤:大資料的目的:生產小型資料弱水三千,只取一瓢。如果擁有著一切,那麼我只是需要能夠解答我關心的問題的答案。如果我們想使用智能手機在指定的範圍內定位選擇一家意式餐廳。只需要輕輕的點擊幾下,智能終端就會列出當前所在的位置周邊10公裡以內的意大利餐廳。這個簡單的LBS應用,其後面用於被查詢的資料庫是及其龐大而複雜的(該地理資料庫包括了全世界所有的餐館的資料,包括它們的基本資料、經緯度、街道地址、使用者評價等等),但是針對所關心的內容,產生的結果資料集確非常的小(例如,在我們的智能終端上只會顯示這五
Time of Update: 2015-04-28
標籤:27.LDB(local DataBase):本機資料庫本機資料庫是指駐留於運行客戶應用程式的機器上的資料庫。本機資料庫提供最快的相應時間。因為在用戶端沒有網路傳輸。本機資料庫位於本地磁碟或區域網路上。如果有幾個使用者同時訪問資料庫,本機資料庫採取攘於檔案的鎖定策略。因此本機資料庫叫基於檔案的資料庫。典型的有Paradox、dBasep、FoxPro、Access。 28.DAQ(data
Time of Update: 2015-04-25
標籤:大資料 laxcus hadoop spark 處理方式 大資料的處理方式有兩種:基於記憶體的串流和基於硬碟的儲存處理。
Time of Update: 2015-04-23
標籤:大資料 laxcus diffuse converge 分布計算
Time of Update: 2015-04-14
標籤:阿里資料採礦競賽 機器學習 競賽介紹:連結這篇文章記錄2015阿里天池大資料競賽中,我的一些代碼,由於目前還在比賽中,僅分享一個naive solution,基於規則,代碼首頁在我的github上:連結,下面是代碼說明。有興趣的請看代碼注釋,恕不詳述。 本repo目錄說明data 存放資料preprocess 資料預先處理rule 根據規則產生提交檔案model
Time of Update: 2015-04-01
標籤:大資料Spark企業級實戰2015-02-12 14:42:46 來自: 我愛我家 大資料Spark企業級實戰的評論 5 《大資料Spark企業級實戰》從零起步,完全從企業處理大資料業務情境的角度出發,基於實戰代碼來組織內容,對於一名大資料愛好者來說,《大資料Spark企業級實戰》內容可以協助您一站式地完成從零起步到進行Spark企業級開發所需要的全部核心內容和實戰需要。
Time of Update: 2015-03-19
標籤:大資料技術自出現以來以一種異常火熱的速度發展著,且種種跡象表明這種發展趨勢在2015年將會繼續持續下去。MapR聯合創始人兼首席執行官John Schroeder預測,2015年將有五大發展趨勢主導大資料技術,MapR是致力於Hadoop分發版的專業公司。 僅僅幾年時間裡,大資料技術就從之前的炒作階段逐漸發展成為新數字時代中的核心技術之一。2014年,企業內部的大資料計劃慢慢地從測試階段走向研發和生產。Schroeder表示,2015年,企業的大資料技術將會進一步推進,
Time of Update: 2015-03-17
標籤:微軟Azure已開始支援hadoop,對於有需要彈性大資料運算的公司可能是個好訊息。據悉,近期微軟已提供一個預覽版的Azure HDInsight(Hadoop on Azure)服務,運行在Linux作業系統上。與對應的Windows一樣,Azure HDInsight on Linux服務也是構建在Hortonworks Data Platform(HDP)之上。HDInsight與Apache Hadoop全面相容,同時整合了微軟自己的商業智慧工具,例如Excel、SQL
Time of Update: 2015-03-16
標籤:中小企業的大資料技術路線選擇(二)-Cassandra+Presto方案 我前面曾經寫過:中小企業的大資料技術路線選擇 和 低調、奢華、有內涵的敏捷式大資料方案:Flume+Cassandra+Presto+SpagoBI 。
Time of Update: 2015-03-12
標籤:上古十大神器之一天機鏡:天機鏡又名崑崙鏡。昆崙山西王母所有,能洞察天機,知曉古今! 1. 動機 在業務系統開發的前期,我們往往只專註到商務邏輯,而忽略了對系統本身的監控。 對硬體資源的監控營運同學提供的ganglia以及ZENOSS
Time of Update: 2015-03-12
標籤:大資料分析在石化企業的應用探討一、大資料應用現狀1、資料量在不斷增加,且資料結構不斷複雜。根據IDC 監測,人類產生的資料量正在呈指數級增長,大約每兩年翻一番,這個速度在2020 年之前會繼續保持下去。這意味著人類在最近兩年產生的資料量相當於之前產生的全部資料量。於此同時,大量新資料來源的出現則導致了非結構化、半結構化資料爆髮式的增長。這些由我們創造的資訊背後產生的這些資料早已經遠遠超越了目前人力所能處理的範疇,大資料時代正在來臨…2、中國企業的大資料現狀目前,中國企業500
Time of Update: 2015-03-11
標籤:DMP(資料管理平台)協助廣告主獲得可行動的洞察 在數字廣告領域,大資料和資料管理平台(DPMs)仍大有可為。DMPs讓廣告主可以使用他們的大資料來做出更靈活更有效營銷決策。 資料管理和分析是業界挑戰 即便在品牌使用大資料來對他們的潛在和現有客戶進行畫像時,多數品牌會發現從資料中抽取跨渠道的洞察仍然極具挑戰。 Ziff Davis發現49%的全球受訪企業在2012年秋季已經實現了資料管理策略。又根據Robert Half
Time of Update: 2015-03-11
標籤: 據有關統計,近30年來,全球人均數字資訊儲存能力每40個月翻一番,“as of 2012, every day 2.5 exabytes(2.5×1018) of data were
Time of Update: 2015-03-09
標籤:Michael Berry對大資料的浮誇之詞頗不以為然。身為旅遊網站TripAdvisor的分析總監,他認為更多的資料未必帶來正面的業務影響,比如大資料和預測性分析的例子。“很多預測性分析的應用其實並不需要所有的資料。”Berry在Predictive Analytics