Time of Update: 2015-08-14
標籤:忽略某些檔案1.忽略某些檔案項目中經常會產生一些Git系統不需要追蹤(track)的檔案。典型的是在編譯產生過程中產生的檔案或是編程器產生的臨機操作備份檔案。當然,你不追蹤(track)這些檔案,可以 平時不用"git add"去把它們加到索引中。 但是這樣會很快變成一件煩人的事,你發現 項目中到處有未追蹤(untracked)的檔案; 這樣也使"git add ." 和"git commit -a" 變得實際上沒有用處,同時"git status"命令的輸出也會有它們。
Time of Update: 2015-10-19
標籤:先說一下我的初衷。機器學習系統現在多紅多NB這件事情我已不必贅述。但是由於機器學習系統的特殊性,構建一個靠譜好用的系統卻並不是件容易的事情。每當看到同行們精彩的分享時,我都會想到,這些複雜精妙的系統,是怎樣構建起來的?構建過程是怎樣的?這背後是否有一些坑?有一些經驗?是否可以“偷”來借鑒?所以我希望做一個更側重“面向過程”的分享,與大家分享一下我們在構建系統時的一些實踐,一些坑,以及如何從坑裡爬出來。另外,我本次分享更側重的是“小
Time of Update: 2015-10-10
標籤:隨著互連網的不斷髮展,大資料正在成為一股熱潮,且業界對大資料的討論已達到一個前所未有的高峰。車連網作為移動互連網大背景下誕生的一個產物,不管是車輛的接入、服務內容的選擇還是服務的精準性,都離不開大資料。車輛上傳的每一組資料都帶有位置資訊和時間,並且很容易形成海量資料。一方面,如果說大資料的特徵是完整和混雜,而車連網與車有關的大資料特徵是完整加精準。如某些與車輛本身有關的資料,都有明確的一個ID,根據這個ID可以關聯到相應的車主資訊,並且這些資訊還是精準的。另一方面,我們可以看到車連網與駕駛
Time of Update: 2015-09-16
標籤:1. 背景隨著大資料時代來臨,人們探索資料越來越多。但是如何對大資料進行儲存與分析呢? 單機PC儲存和分析資料存在很多瓶頸,包括儲存容量、讀寫速率、計算效率等等,這些單機PC無法滿足要求。2. 為解決這些儲存容量、讀寫速率、計算效率等等問題,google大資料技術開發了三大革命性技術解決這些問題,這三大技術為:(1)MapReduce(2)BigTable(3)GFS技術革命性:
Time of Update: 2015-09-16
標籤: HDFS中資料管理與容錯1.資料區塊的放置 每個資料區塊3個副本,就像上面的資料庫A一樣,這是因為資料在傳輸過程中任何一個節點都有可能出現故障(沒有辦法,廉價機器就是這樣的),為了保證資料不能丟失,所以存在3個副本,這樣保證了硬體上的容錯,保證資料傳遞過程中準確性。 3個副本資料,放在兩個機架上。比如上面機架1存在2個副本,機架2存在1個副本。
Time of Update: 2015-08-31
標籤:原文地址:http://www.parallellabs.com/2013/08/25/impala-big-data-analytics/文 / 耿益鋒 陳冠誠 大資料處理是雲端運算中非常重要的問題,自Google公司提出MapReduce分散式處理架構以來,以Hadoop為代表的開源軟體受到越來越多公司的重視和青睞。以Hadoop為基礎,之後的HBase,Hive,Pig等系統如雨後春筍般的加入了Hadoop的生態系統中。今天我們就來談談Hado
Time of Update: 2015-08-16
標籤:我們使用 sbt 建立、測試、運行和提交作業。該教程會解釋你在我們的課程中將會用到的所有 sbt 命令。工具安裝頁說明了如何安裝 sbt。我們一般將代碼和庫做成jar包,通過spark-submit 提交到spark 叢集上運行。1)下載安裝:
Time of Update: 2015-08-16
標籤:1.kafka是一種高輸送量的分布式發布訂閱訊息系統,它可以處理消費者規模的網站中的所有動作流資料Step 1: Download the codeDownload the 0.8.2.0 release and un-tar it.> tar -xzf kafka_2.10-0.8.2.0.tgz> cd kafka_2.10-0.8.2.0Step 2: Start the server首先要create
Time of Update: 2015-08-07
標籤:
Time of Update: 2015-08-05
標籤:接著昨天的list,也是學習集合的相關知識ListBuffer、ArrayBuffer、Queue、stack相關操作 1.ListBuffer、ArrayBuffer代碼實現:ListBuffer與ArrayBuffer都是mutable可變的與java中的定義也差不多,可以追加的。 2.Queue、Stack相關操作:隊列是一端進去一端出來,而stack也是後進先出的原則,他們都是mutable可變的 import
Time of Update: 2015-08-04
標籤: HDInsight cluster on Linux 登入 Azure portal (https://manage.windowsazure.com )點擊左下角的 NEW 按鈕,然後點擊 DATA SERVICES 按鈕,點擊 HDINSIGHT,選擇 HADOOP ON LINUX,如所示。 輸入集群名稱,選擇叢集大小和帳號,設定叢集的密碼和儲存帳號,下表是各個參數的含義和配置說明。NameValueCluster NameName of the
Time of Update: 2015-07-31
標籤:DT大資料夢工廠 第5講 http://yun.baidu.com/s/1jGjFpWy 本節王老師講了數組。最主要的是使用了scala worksheet這個功能。這個功能可以列印出每一行代碼的運行情況。 package com.dt.scala.helloimport scala.collection.mutable.ArrayBufferobject ArrayOps { def main(args: Array[String]): Unit = {
Time of Update: 2015-07-31
標籤:關於Scala中的Regex與模式比對結合的RegexRegRegex的實現:Regex的定義與其它語言差不多,只需在運算式後加一個.r,並且可以遍曆相應的運算式進行匹配 //定義的Regex val regex="""([0-9]+) ([a-z]+)""".r //由數字與字母組成的常量 val numPattern = "[0-9]+".r //由數字組成的常量 val numberPattern = """\s+[0-9]+\s+""".r //由s與數字+
Time of Update: 2015-07-29
標籤:scala類屬性學習了王家林老師的scala類屬性的視頻講座,總結如下:var變數有預設的類似於java的get和set方法,不需要顯示的聲明;val變數有預設get方法package com.fish.scala/** * @author fish * @description life is short ,you need spark! *
Time of Update: 2015-07-28
標籤:hadoop有關hdfs的連結http://hadoop.apache.org/docs/current/api/ (Apache Hadoop Main 2.7.1 API) http://slaytanic.blog.51cto.com/2057708/1101111/ (hdfs-site.xml 配置項說明) http://archive-primary.cloudera.com/cm5/installer/5.4.3/
Time of Update: 2015-07-26
標籤:VOQ機制 本章介紹的VOQ是一種新型的QoS機制,目的是為瞭解決著名的交換器HoL難題。但VOQ強烈依賴於調度演算法,例如,一個48口的交換器,每個連接埠都要維護48-1個FIFO緩衝隊列,一共48x47=2256個緩衝隊列,這一方面對交換器的硬體條件提出了較高要求,也對如何設計良好的轉寄包調度演算法提出了巨大的挑戰,目前僅有Cisco一家推出了商用產品,足見其複雜程度。學習一下VOQ方案的解決問題的思路,還是有助於我們更深入的瞭解交換器的內部運作機制。 圖
Time of Update: 2015-07-22
標籤: 馬鈴薯視頻:http://www.tudou.com/programs/view/99sazBunsHg/你想瞭解大資料,你想成為年薪百萬嗎?那你還等著什麼,快點來吧!跟著王家林老師學習spark大資料這一講,王老師主講了Scala環境的搭建1.安裝Java(建議安裝java8),安裝好後,設定環境變數(java_home、path、classpath這個環境變數)2.安裝Scala,:spark.apache.org(建議安裝2.10.x以上版本),設定環境變數(scala_
Time of Update: 2015-07-19
標籤: 柯南君:看大資料時代下的IT架構(3)訊息佇列之RabbitMQ-安裝、配置與監控 一、安裝1、安裝Erlang 1)系統編譯環境(這裡採用linux/unix 環境)① 安裝環境虛擬機器:VMware® Workstation 10.0.1 buildLinux系統:CentOS6.5rabbitMQ官網下載:http://www.rabbitmq.com/download.htmlErlang的官網下載:
Time of Update: 2015-07-18
標籤:接入層網路 伺服器虛擬化技術使得傳統的接入層概念發生變化,即不再是物理網口層級的接入、管理,而是需要深入物理機內部,在虛擬機器層面對虛擬機器的接入層進行管理,包括交換器延伸,相應的網路管理、策略配置。雲端運算業務要求網路接入層必須下沉到虛擬機器層級,這中間跨越了物理機的網卡,虛擬化管理平台Hypervisor,虛機網卡三個邏輯層面。 本章主要內容
Time of Update: 2015-07-16
標籤:虛擬化資料中心的擴張從本節開始,對資料中心內部的網路架構如何應對雲端運算業務的浪潮進行關鍵技術講解。 主要內容