Time of Update: 2018-12-07
看到這個標題,大家一定會問了。這個整合如何定義?我個人認為,所謂的整合是指:我們可以編寫MapReduce程式,從HDFS中讀取資料然後插入到Cassandra中。也可以是直接從Cassandra中讀取資料,然後進行相應的計算。從HDFS中讀取資料然後插入到Cassandra中對於這種類型,我們可以按照以下幾個步驟來操作。1 將需要插入Cassandra的資料上傳到HDFS中。2
Time of Update: 2018-12-07
我們在之前的文章(談談Cassandra的用戶端)中講解了如何在Client端查詢Cassandra中的資料。為什麼要使用RingCacheCassandra的內部讀寫流程大概是這樣的:1 Client端先隨機找到Cassandra叢集中的一台機器,然後將查詢請求發送給這台Cassandra機器。2 接收到查詢請求的Cassandra機器會判斷需要查詢的資料是否在本機中:如果在本機中,直接查詢;如果不在本機中,將請求轉寄給另外一台機器來查詢,並等待另外一台機器的查詢結果。3
Time of Update: 2018-12-07
文章目錄 1.運行MapReduceJob2.啟動Cassandra叢集1.啟動Cassandra叢集2.運行MapReduceJob3.重新啟動Cassandra叢集 一個Cassandra叢集需要投入時候,絕大多數時候都是會有初始化資料的,比如部落格網站中所有的部落格資料,資料分析網站中所有的網頁資訊,電子商務網站中所有的商品資訊等等。這些初始化資料往往量的都非常大,不適用直接使用Thrift
Time of Update: 2018-12-07
前一陣子Cassandra-0.7.0-beta1發布了,今天把代碼拿下來粗略瀏覽了一下,發現主要有以下幾點變化:1
Time of Update: 2018-12-07
為什麼說NoSQL重要SQL語言和關係型資料庫(MySQL,PostgreSQL,Oracle,等等)是通用的資料解決方案,佔有絕大多數的市場。不過在最近興起的NoSQL運動中,湧現出來了一批具備高可用性,支援線性擴充,支援Map/Reduce操作等等特性的資料產品,它們具有如下特性:頻繁的寫入操作,相對較少的讀取統計資訊的操作(比如一個web訪問計數器)應該使用基於記憶體的key/value儲存系統,比如Redis,或者是具備本地更新特性的文檔儲存系統,如MongoDB。海量資料(比如資料倉儲
Time of Update: 2018-12-07
今天剛剛讀完了《Head First Design
Time of Update: 2018-12-07
今天得到了通過07年機器人世界盃第一輪審核的訊息!!!!對我來說,這實在是一個好訊息!六月的亞特蘭大,你一定要等我的到來阿~~~~ RoboCup 2007 – Soccer Simulation LeagueQualified TeamsThe qualified teams are ordered by country.2DKickOffTUGAustriaStephan GspandlGraz University of TechnologyBahia2DBrazilMarco
Time of Update: 2018-12-07
在這篇《談談Cassandra的用戶端》文章中,我們談到了如何使用Thrift API以及更加進階的封裝(Hector)如果將資料匯入到到Cassandra中,但是在匯入大量資料的時候這會遇到很多的問題,比如插入失敗,逾時等等問題。為瞭解決這個問題,我們可以嘗試使用Binary Memtable。在Cassandra的wiki上,對Binary Memtable的描述如下:Binary Memtable is the name of Cassandra's bulk-load
Time of Update: 2018-12-07
Cassandra是一個開源的分散式資料庫,結合了Dynamo的Key/Value與Bigtable的面向列的特點。Cassandra的特點如下:1.靈活的schema:不需要象資料庫一樣預先設計schema,增加或者刪除欄位非常方便(on the fly)。2.支援range查詢:可以對Key進行範圍查詢。3.高可用,可擴充:單點故障不影響叢集服務,可線性擴充。我們可以將Cassandra的資料模型想象成一個四維或者五維的Hash。ColumnColumn是Cassandra中最小的資料單元。
Time of Update: 2018-12-07
最近在測試HBase時遇到一個非常奇怪的問題:叢集有7台機器,其中1台Master,6台RegionServer。但是Master只能控制其中1台RegionServer,而無法控制其他5台RegionServer。開啟master的記錄檔,發現以下錯誤資訊:2011-04-22 16:37:21,242 WARN org.apache.hadoop.hbase.master.AssignmentManager: Failed assignment of -ROOT-,,0.70236052
Time of Update: 2018-12-07
在Cassandra的官方部落格中,新發布了一篇關於Cassandra二級索引的文章,寫得不錯,翻譯出來與大家一起分享:) 概述在Cassandra中,對列值(column
Time of Update: 2018-12-07
在上一篇文章《使 用Binary Memtable將大量資料匯入Cassandra》中,講解了如何使用Binary Memtable將大量資料匯入Cassandra。這一周一直在看如果使用Binary Memtable的方式匯入大量的資料。今天看下來,我還是覺得在目前這個版本不適合使用這種方式去匯入資料。原因如下:在0.6+的版本中,Cassandra叢集中取消了UDP通訊,完全採用TCP監聽固定連接埠(7000)。這種方式導致了2個嚴重的問題:1 如果某台機器是Cassandra
Time of Update: 2018-12-07
:http://files.cnblogs.com/gpcuster/source_code.rar本目錄中CassSeller對應的是Cassandra-0.6.x版本的代碼CassSeller-0.7對應的是Cassandra-0.7.x版本的代碼對於Cassandra-0.6.x版本,開啟conf/storage-conf.xml檔案,在Keyspace配置項中,新添加一個Keyspace的配置資訊,內容如下:<Keyspace
Time of Update: 2018-12-07
Hadoop下面的子項目ZooKeeper是一個用於協調分布式程式的服務。我們可以利用它來保證各個機器之間的資料同步。單機環境運行ZooKeeper1 下載ZooKeeper:http://labs.xiaonei.com/apache-mirror/hadoop/zookeeper/zookeeper-3.2.2/zookeeper-3.2.2.tar.gz2 解壓。3
Time of Update: 2018-12-07
0.90.x版本的HBase中的檔案是儲存在HFile中的。關於HFile檔案的詳細介紹,可以查看這篇文章:http://www.data-works.org/download/hfile.pdf這篇文章中介紹了以下五點內容:HFile的作用。HFile的格式。HFile的效能。HFile的使用注意事項。HFile的編程介面。HFile中有一個很重要的參數,那就是block size。如果我們寫入hfile中的某一個value的值大於block size會怎麼樣?於是有如下的測試代碼: 1:
Time of Update: 2018-12-07
前一段時間,Cassandra0.7已經正式發布啦。接下來,Cassandra1.0即將發布。郵件清單的內容如下:Way back in Nov 09, we did a users survey and asked what featurespeople wanted to see. Here was my summary of the responses:http://www.mail-archive.com/cassandra-user@incubator.apache.org/msg0
Time of Update: 2018-12-07
問題通過前面的文章:《談談Cassandra的用戶端》和《大話Cassandra資料模型》我們已經瞭解了Cassandra的資料模型和編程介面的情況。假如我們在實際的應用中我們的資料是這樣儲存的:
Time of Update: 2018-12-07
概述Solr單機支援的搜尋資料量是有一定上限的,這個取決於搜尋的複雜程度,伺服器的硬體設定與業務的要求等等,所以將搜尋功能分布化將是對於大資料搜尋的一個必然趨勢。Solr從1.3版本開始,內建了分布式搜尋(Distributed Search)。這個功能使得Solr能夠通過多伺服器進行橫行擴充,對資料進行水平分割,從而支援海量資料的搜尋功能。Solr-3.6.1版本對分布式搜尋的支援功能如下:搜尋功能模組是否支援分布式搜尋Query componentYFacet
Time of Update: 2018-12-07
Hadoop系統為了保證資料的一致性,會對檔案產生相應的校正檔案,並在讀寫的時候進行校正,確保資料的準確性。比如我們遇到的這個Case:執行的命令:hadoop jar dw-hadoop-2010_7_23.jar jobDriver -files tb_steps_url_path_dim.txt multisteps_output 2011-01-25出錯日誌的提示:org.apache.hadoop.fs.ChecksumException: Checksum error: file:
Time of Update: 2018-12-07
文章目錄 Cassandra啟動有新的SSTable檔案需要寫入磁碟 在《如何安裝和配置Cassandra》中,我們可以在DataFileDirectories中配置資料的存放位置。當Cassandra啟動後,向其中插入的資料就會放在DataFileDirectories的目錄下, 這裡有2個Column