Time of Update: 2018-12-04
首先要強調的是,本篇教程只是左手手型要點的講解,不涉及左手肘部,以及整個左臂,以及右臂和全身等的要點,正式教程的寫作計劃是:左手-左肘-左臂-左臂節奏-左肩-右手-右手腕-右肘部-右臂-右肩-雙肩-頭部-上身-雙腿-雙腳-節奏-全身綜述。是這樣一個順序,每個要點都會如本篇文章一樣,有很多圖片來配和講解,之前發布的我投籃練習的視頻只用作之前的一些文章中的論據而已,只是作為資料,不作為參考也不作為示範,示範可參照喬丹視頻,本教程主要以文字部分為主。
Time of Update: 2018-12-04
Nutch 2.0 的主要一些變化1. Storage Abstraction initially with back end implementations for HBase and HDFS extend it to other storages later e.g. MySQL etc... 這裡說的是一個儲存層的抽象,因為原來nutch的連結與資料的儲存都是在HDFS上的,新的Nutch
Time of Update: 2018-12-04
Boost Tokenizer 使用介紹-------------------------1. 介紹Boost Tokenizer提供了一種把字元序列轉換成一組Token的能力,當然,你也可以定義TokenizerFunction來自訂序列的切分符號,如果不指定,預設是以空格為分割,去掉一些標點符號。2. 幾個簡單的例子下面是一個簡單的例子://
Time of Update: 2018-12-04
emacs Magit簡單介紹---------------------1. 什麼是Magit 在介紹Magit之前,我們先來瞭解一下什麼是Git,Git 是 Linux Torvalds 為了協助管理 Linux
Time of Update: 2018-12-04
Hadoop 之 Secondary Sort介紹---------------------------我們知道,在reduce之前,MP架構會對收到的<K,V>對按K進行排序,而對於一個特定的K來說,它的List<V>是沒有被排過序的,就是說這些V是無序的,因為它們來自不同的Map端,而且很多應用也不依賴於K所對應的list<V>的順序,但是有一些應用就要就要依賴於相同K的V的順序,而且還要把他們彙總在一起,下面會提出這樣一個問題,是參考Hadoop
Time of Update: 2018-12-04
1.查詢高於平均價格的商品名稱:SELECT item_name FROM ebsp.product_market_price WHERE item_price > (SELECT AVG(item_price) FROM ebsp.product_market_price2.oracle9i以上版本,可以實現將某張表的資料同時插入到多張表中。例:INSERT ALL WHEN deptno=10 THEN INTO dept10
Time of Update: 2018-12-04
在編寫MapReduce應用程式時,除了最基本的Map模組、Reduce模組和驅動方法之外,使用者還可以通過一些技巧最佳化作業以提高其效能。對使用者來說,合理地在MapReduce作業中對程式進行最佳化,可以極大地提高作業的效能,減少作業執行時間。我們從以下幾個方法分析MapReduce作業的最佳化方法。1 選擇Mapper的數量
Time of Update: 2018-12-04
Xapian介紹 ----------1. 簡單介紹 Xapian 是一個開源的搜尋引擎庫,是用C++來編寫的,准許GPL協議(http://www.opensource.org/licenses/gpl-license.php),它現在可以與Perl,python,PHP,Java等語言來綁定使用。 和Lucene一樣,Xapian只是一個搜尋引擎工具庫,使用者可以在其上自己擴充其適合的應用,它是基於機率模型來做為查詢分數計算的基本,當然,它還提供了豐富的Boolean查詢功能。
Time of Update: 2018-12-04
Xapian 學習筆記 2 一些概念---------------------------1. 同步概念
Time of Update: 2018-12-04
使用awk對文檔中特定欄位的排序----------------------------------------------------1. 問題定義現在要對如下文檔按特定欄位排序,lemo@debian:~/Testspace/awk$ cat fileNameSexSalary Lemoman4000 Jokwoman3000 Jobman6000
Time of Update: 2018-12-04
dfs.datanode.handler.countdatanode上用於處理RPC的線程數。預設為3,較大叢集,可適當調大些,比如8。需要注意的是,每添加一個線程,需要的記憶體增加。tasktracker.http.threadsHTTP server上的線程數。運行在每個TaskTracker上,用於處理map
Time of Update: 2018-12-04
Xapian 學習筆記 4 分面搜尋------------------------1. 什麼是分面搜尋 分面搜尋使使用者可以動態對使用者所查詢的命中文檔進行特定屬性的彙總,分面搜尋在很多地方都有應用,特別昌電子商場中,使用者輸入一個查詢條件,伺服器返回這個查詢所命中的文檔的分類資訊,如使用者查詢“電腦”,那伺服器返回命中“電腦”這個關鍵詞的所有文檔,並且對這些文檔進行類型的聚類,如平板電腦、膝上型電腦、台式機等分類都有出現“電腦”這個詞,這種聚類是多維度,可能這些命中的文檔屬於不同的商家,
Time of Update: 2018-12-04
Nutch 2.0 終於來了-------------------------帶著大部分人的期待,Nutch 2.0終於發布了,它在Nutch 1.x的基礎上做了比較大的改變,主要還是在它的儲存層的抽象上,Nutch 2.0的計劃最終由使用者對於Nutch對No-sql的不支援而建立起來的,最初的版本叫做NutchBase,由Dogacan
Time of Update: 2018-12-04
經過痛苦的折騰,終於將spring從1.2.4升級到3.0.2,將hibernate從3.0.5升級到3.5.3,以下是遇到的一些問題。1.刪除了舊的包,引入新的包,spring的新包和舊包差別很大,舊包就一個,新包分成了好多。2.model中是所有表對應的類,重新加上了對Serializable的實現,要不就會報錯。3.web下是部分和ServletRequestUtils相關的函數做了名稱的改變,因為新老版本包和函數的名稱都不一樣。4.hbm下是表和類別關係的設定檔,舊檔案有好多表的列名後有
Time of Update: 2018-12-04
將hibernate升級後相同的hql竟然產生了不同的sql。以下分別是hql和新老版本產生的sql。我的sybase15不識別crossover,只好另想辦法。select new
Time of Update: 2018-12-04
Nutch 2.0 之 Apache Gora介紹-----------------1. 什麼是Apache Gora Apache Gora是一個開源的ORM架構,主要為大資料提供記憶體資料模型與資料的持久化。目前Gora支援對於列資料、key-value資料,文檔資料與RDBMS資料的儲存,還支援使用Apache Hadoop來對對大資料進行分析。2. 為什麼要使用Apache Gora 雖然目前市面上有很多不錯的關聯式資料庫的ORM架構,但是基於資料模型的架構如JDO還是有一些不足,
Time of Update: 2018-12-04
擴充Nutch外掛程式實現自訂索引欄位1.Nutch與Solr的使用介紹 1.1 一些基本的配置在conf/nutch-site.xml加入http.agent.name的屬性 產生一個種子檔案夾,mkdir -p urls,在其中產生一個種子檔案,在這個檔案中寫入一個url,如http://nutch.apache.org/ 編輯conf/regex-urlfilter.txt檔案,配置url過濾器,一般用預設的好了,也可以加入如下配置,只抓取nutch.apache.org這個網址
Time of Update: 2018-12-04
Nutch 2.0 之 Apache Gora MR介紹-----------------1. 介紹 Apapche Gora內建了對於Apache Hadoop的支援,而Gora的dataStore可以用來做為InputFormat與OutputFormat的輸入與輸出,然而這些輸出的對象都會被序列化,Gora擴充了Avro的DatumWriters來實現的。2. 一個簡單的例子 下面是gora-tutorial中的一個簡單的例子來說明Gora
Time of Update: 2018-12-04
Nutch 2.0 抓取流程介紹---------------------1. 整體流程InjectorJob => GeneratorJob => FetcherJob => ParserJob => DbUpdaterJob => SolrIndexerJobInjectorJob : 從檔案中得到一批種子網頁,把它們放到抓取資料庫中去GeneratorJob: 從抓取資料庫中產生要抓取的頁面放到抓取隊列中去FetcherJob:
Time of Update: 2018-12-04
先自訂一個UDAF,由於udaf是多輸入一條輸出的彙總,所以結果拼成字串輸出,代碼如下:public class Top4GroupBy extends UDAF { //定義一個對象用於儲存資料 public static class State { private Map<Text, IntWritable> counts; private int limit; } /** *