Time of Update: 2018-12-03
greenplum 實驗,動態增加節點1.我原有在hadoop4-hadoop6上初始化了一個greenplum的叢集2.所有的primary,mirror都啟動著,我串連master,在兩個表裡插入記錄:aligputf8=# insert into pg_catalog.pg_filespace_entry values(3052,15,'/home/gpadmin1/cxf/gpdata/gpdb_p1/gp6');INSERT 0 1aligputf8=# insert into pg_
Time of Update: 2018-12-03
在Postgresql/Greenplum資料庫中,彙總函式有兩種實現方式:HashAggregate與GroupAggregate。 我們現在通過一個最簡單的sql來分析這兩種彙總的區別以及其應用情境。 select count(1) from pg_class group by oid;一、兩種實現演算法的比較:HashAggregate 對於hash彙總來說,資料庫會根據group
Time of Update: 2018-12-03
之前在學習xml文本解析,發現一個比較好用的開來源程式,tinyxml,在這裡分享一下tinyxml的原理跟XML檔案的遍曆操作。TinyXML是一個簡單的,輕量級的,由C++實現的XML文檔的解析器,它可以被其它程式方便地整合進去使用關於tinyxml的剖析:下面是名為 example.xml的文檔,後續的剖析都會以這個xml文檔為例:example.xml(1)tinyxml把xml文檔建立成一棵DOM(Document
Time of Update: 2018-12-03
在hadoop中的例子TeraSort,就是一個利用mapredue進行排序的例子。本文參考並簡化了這個例子:
Time of Update: 2018-12-03
【Catalan數——卡特蘭數】一.Catalan數的定義令h(1)=1,Catalan數滿足遞迴式:h(n) = h(1)*h(n-1) + h(2)*h(n-2) + ... + h(n-1)h(1),n>=2該遞推關係的解為:h(n) = C(2n-2,n-1)/n,n=1,2,3,...(其中C(2n-2,n-1)表示2n-2個中取n-1個的組合數)二.Catalan數公式推導: 三.Catalan數的典型應用:1.括弧化問題。矩陣鏈乘:
Time of Update: 2018-12-03
因為要用到雲端運算下的資料採礦,所以就簡單看了一下mahout配置,mahout是一個基於Map/Reduce的機器學習演算法庫,運行在hadoop叢集上廢話不多說,下面看配置過程1.到mahout官網上下載mahout-distribution-0.4.tar.gz,這個是已經編譯好的包,如果下的是源碼包,則需要安裝maven來編譯2.前面已經搭過hadoop,這裡不再說,下面設定環境變數,sudo vi /etc/profile(關於ubuntu環境變數,請看參考) export
Time of Update: 2018-12-03
在Recsys中看到一個關於如何解決資料集偏斜的問題,遂想到以前也考慮過這個問題,所以就總結了一些以前看的資料。問題定義先來說說樣本的偏斜問題,也叫資料集偏斜(unbalanced),它指的是參與分類的兩個類別(也可以指多個類別)樣本數量差異很大。比如說正類有10,000個樣本,而負類只給了100個,這會引起的問題顯而易見,可以看看下面的圖:方形的點是負類。H,H1,H2是根據給的樣本算出來的分類面,由於負類的樣本很少很少,所以有一些本來是負類的樣本點沒有提供,比中兩個灰色的方形點,如果這兩個點
Time of Update: 2018-12-03
1.hadoop入門篇,包括軟體下載及配置,並保證單機和偽分布模式可以運行通過,請看hadoop官網 2.叢集搭建筆者在hadoop叢集搭建中,走了很多彎路,希望大家莫犯同樣的錯誤(a)ssh免密碼登陸剛開始ssh localhost 都要求輸入密碼,後來在masters機器上,將.ssh目錄許可權設為500,authroized_keys設為600才好ubuntu目錄許可權修改 ssh-keygen 產生出 id_rsa, id_rsa.pub, 已經都放到正確位置(.ssh),
Time of Update: 2018-12-03
SVM模型有兩個非常重要的參數C與gamma。其中 C是懲罰係數,即對誤差的寬容度。c越高,說明越不能容忍出現誤差。C過大或過小,泛化能力變差gamma是選擇RBF函數作為kernel後,該函數內建的一個參數。隱含地決定了資料對應到新的特徵空間後的分布,gamma越大,支援向量越少,gamma值越小,支援向量越多。支援向量的個數影響訓練與預測的速度。Grid SearchGrid
Time of Update: 2018-12-03
1.首先在VPN配置裡面配置好有線串連.2.然後按照以下方法操作:sudo gedit /etc/network/interfacesauto loiface lo inet loopbackauto eth0iface eth0 inet staticaddress xxxxnetmask xxxxgateway xxxxsudo gedit /etc/resolv.confnameserver 10.10.0.21然後sudo /etc/init.d/networking
Time of Update: 2018-12-03
我在solr中嘗試了以下三種開源中文分詞器,其中兩種都因為solr版本過高不能用,鬱悶,後來將JAR包反編譯,找到了原因,下面先簡要說明一下三種開源中文分詞器 庖丁解牛:google code上最後一次代碼提交是2008.6月,不是很活躍,但用的人還很多mmseg4j:google code上最後一次代碼提交是2010.12月,應該還算活躍,採用MMSeg演算法,有兩種分詞方法:Simple和ComplexIKAnalyzer:最近很活躍,2011.3月在google code上提交了一個版本
Time of Update: 2018-12-03
開源系統 首頁:http://code.google.com/p/tmsvm/文本挖掘無論在學術界還是在工業界都有很廣泛的應用情境。而文本分類是文本挖掘中一個非常重要的手段與技術。現有的分類技術都已經非常成熟,SVM、KNN、Decision
Time of Update: 2018-12-03
mahout lucene.vector --dir /home/test/test-in/index/ --output /home/test/test-in/outdex/part-out.vec --field body --dictOut /home/test/test-in/outdex/dict.out 問題1:版本問題( "Exception in thread "main" org.apache.lucene.index.CorruptIndexException:
Time of Update: 2018-12-03
閾值化: 希望對映像中的像素做出最後決策,或直接剔除一些低於或高於一定值的像素,在OpenCV中,cvThreshold()可以完成這個任務,基本思想是給定一個數組和一個閾值,然後根據數組中每個元素的值是低於還是高於閾值來進行處理。本常式chapter_ch5_example_2涉及的資料結構及方法:cvSplit分割多通道數組成幾個單通道數組或者從數組中提取一個通道 void cvSplit( const CvArr* src, CvArr* dst0, CvArr* dst1
Time of Update: 2018-12-03
使用ant編譯hive需要的工具:ant 具體安裝,請自己在網上尋找1.使用svn檢出hive的原始碼: svn地址:http://svn.apache.org/repos/asf/hadoop/hive/trunk
Time of Update: 2018-12-03
由於剛開始理解錯誤,以為搜尋索引可以作為資料採礦的輸入資訊,後面才發現錯了,由solr/nutch/lucene形成的只是搜尋索引,只要由使用者提供查詢關鍵字,然後就可以查到該關鍵字來自哪一篇文檔,並不是一篇文檔的文字列表資訊,而挖掘是需要有整篇文檔的文字列表(檔中所有單詞的集合),才能挖出其中的關聯資訊。詳細看了一下Nutch抓取資料後的檔案:Nutch的輸出檔案主要可分為crawldb、index、indexs、linkdb和segments。Crawldb是所有需要抓取的超串連資訊(另說:
Time of Update: 2018-12-03
自適應閾值:是一種改進了的閾值技術,其中閾值本身是一個變數,自適應閾值T(x,y)的每個像素點都不同,通過計算像素點周圍的b*b地區的加權平均,然後減去一個常數來得到自適應閾值。 cvAdaptiveThreshold方法:Provides adaptive thresholding binary image.void cvAdaptiveThreshold( IplImage* src, IplImage* dst, double max,CvAdaptiveThreshMethod
Time of Update: 2018-12-03
封裝Libsvm與Liblinear開篇我們基於以下情境:
Time of Update: 2018-12-03
影像金字塔被廣泛應用於各種視覺應用中。影像金字塔是一個映像集合,集合中映像都源於同一個原始映像,而且是通過對原始映像連續降採樣獲得,直到達到某個中止條件才停止降採樣。(當然,降為一個像素肯定是中止條件) 本常式用到兩個庫函數cvPyrDown、cvPyrUp。PyrDown映像的下採樣 void cvPyrDown( const CvArr* src, CvArr* dst, int filter=CV_GAUSSIAN_5x5 );src 輸入映像. dst 輸出映像,
Time of Update: 2018-12-03
之前做過一些文本挖掘的項目,比如網頁分類、微博情感分析、使用者評論挖掘,也曾經將libsvm進行封裝,寫了一個文本分類的開軟軟體Tmsvm。所以這裡將之前做過一些關於文本分類的東西整理總結一下。1 基礎知識1. 1 樣本整理文本分類屬於有監督的學習,所以需要整理樣本。根據業務需求,確定樣本標籤與數目,其中樣本標籤多為整數。在svm中其中如果為二分類,樣本標籤一般會設定為-1和1,而在樸素貝葉斯方法中,一般為0和1,但不是固定的,標籤的設定和演算法本身的性質有關的。如下面的整理的樣本,1為正類,-