Time of Update: 2018-12-03
概要抑制語言的分離慾望:C++將私人成員指定為不可訪問的,但是並沒有指定為不可見的,雖然這樣自有其好處,但是可以考慮通過Pimpl慣用法使私人成員真正的不可見,從而實現編譯器防火牆,並提高資訊隱藏度(條款11和41)。 討論如果建立“編譯器防火牆”將調用代碼和類的私人部分完全隔離是有意義的,就應該使用Pimpl慣用法:將它們隱藏在一個不透明的指標後面(即指向已經聲明但未定義的類的指標,使用恰當的Smart指標則更好)。例如: class Map { // … private:
Time of Update: 2018-12-03
1.用haddop提供的C API to HDFS來實現檔案寫入到HDFS中。過程中主要是在配置環境花了點時間參考官網:http://hadoop.apache.org/common/docs/r0.20.0/libhdfs.htmlAPI主要可以去hadoop軟體包解壓目錄中查看hdfs.h定義的一些已實現的函數一門語言的初學入門例子,一般都是“hello,world”,下面看寫hdfs檔案代碼:#include "hdfs.h" int main(int argc, char **argv)
Time of Update: 2018-12-03
Nutch中內建對搜尋結果的聚類,使用開源的Carrot2,以外掛程式形式被調用,大概看了一下nutch關於clustering這一塊的搜尋源碼,它會顯示出URL和title,可是用mahout做文本聚類的話,最後的聚類結果中,只有向量,
Time of Update: 2018-12-03
遞迴版本:void printout(int v){ cout << "now visiting is:"<<v<<endl;} void tophelp(Graph *g,int v) //採用DFS演算法{ g->setMark(v,VISITED); for(int w=g->first(v);w<g->n();w=g->next(v,w)) {
Time of Update: 2018-12-03
輸入分析:mahout下處理的檔案必須是SequenceFile格式的,所以需要把txtfile轉換成sequenceFile,而聚類必須是向量格式的,mahout提供下面兩個命令來將文本轉成向量形式1.mahout
Time of Update: 2018-12-03
有500多個csv檔案,想匯入SQL資料庫內,資料庫欄位與檔案欄位是一樣的, 如何寫大量匯入語句。 DECLARE @dir sysname,@cmd nvarchar(max);SET @dir = 'C:/';CREATE TABLE #tmp(filename nvarchar(1024));SET @cmd = N'dir "' + @dir + '*.csv" /B'INSERT #tmp EXEC master.dbo.xp_cmdshell @cmd;DELETE #tmp
Time of Update: 2018-12-03
平均背景法的基本思路是計算每個像素的平均值和標準差作為它的背景模型,利用平均值和標準差來描述每一個像素的變化。平均背景法使用四個OpenCV函數:cvAcc() 累積映像cvAbsDiff() 計算一定時間內的每幀映像之差cvInRange() 將映像分割成前景地區和背景地區cvOr() 將不同的彩色通道映像合成為一個掩模?映像待實現函數:void AllocateImages(IplImage *I); //為映像分配空間void DeallocateImages();
Time of Update: 2018-12-03
在Greenplum中,對於任意一個SQL,我們想擷取這個SQL執行後的欄位名是比較難的。比方說在寫一個通用工具的時候,使用copy命令將一個SQL匯出成文本,但是每個欄位的名稱匯出的文本中卻沒有,如果使用自己解析SQL的話就太複雜了如果我們想取得這些欄位名的話,不真正執行sql,因為在產生執行計畫的時候已經,我知道的有以下幾種方法:1.使用JDBC,prepareStatement先產生執行計畫,然後擷取欄位名: PreparedStatement pstmt =
Time of Update: 2018-12-03
在greenplum裡面有一種appendonly表,只能insert,不能update、delete的一種表,對於壓縮表跟列儲存來說,前提是必須是appendonly的表。下面介紹appendonly表的一些特性。1.首先建一張appendonly的表:aligputf8=# create table cxf_test1 with(appendonly=true,compresslevel=5) as select generate_series(0,1000)
Time of Update: 2018-12-03
因為C語言所有複雜的指標聲明,都是由各種聲明嵌套構成的。如何解讀複雜指標聲明呢?右左法則是一個既著名又常用的方法。不過,右左法則其實並不是 C標準裡面的內容,它是從C標準的聲明規定中歸納出來的方法。C標準的聲明規則,是用來解決如何建立聲明的,而右左法則是用來解決如何辯識一個聲明的,兩 者可以說是相反的。右左法則的英文原文是這樣說的:The right-left rule: Start reading the declaration from the innermost parentheses,
Time of Update: 2018-12-03
OpenSolaris新特性解析之一:Opensolaris之前身今世 http://bbs.chinaunix.net/viewthread.php?tid=1221539OpenSolaris新特性解析之二:ZFS http://bbs.chinaunix.net/viewthread.php?tid=1234907OpenSolaris新特性解析之三:SMF
Time of Update: 2018-12-03
這兩天一直糾結是用lucene來做搜尋應用,還是用solr來做搜尋應用。lucene只提供一個可查詢的包,用它來實現搜尋的好處是,應用需要什麼,我就用它提供的相應功能即可。而solr本身就是基於lucene的應用,對lucene又做了封裝,這就相當於是在第二層基礎之上開發,所以要改它是需要花時間的。但solr提供了很多lucene沒有的功能,不管了,老師說要用solr,那就用solr吧lucene和solr的對比:1.http://www.blogjava.net/luopeizhong/art
Time of Update: 2018-12-03
#include <stdio.h>#include <stdlib.h>#include <string>using namespace std;// Floyd's 能夠找到所有點對之間的最短路徑,複雜度為:(O (n^3) )//input 是鄰接矩陣 output是最短路徑// C是鄰接矩陣// A 是所有點對的最短路徑的矩陣int ComputeFloydAPSP(int *C, int n, int *A, string* s){ int i,
Time of Update: 2018-12-03
趨勢科技的筆試: 1、#include <stdio.h> class A{public: A(){func(0);}; virtual void func(int data){printf("A1 :%d/n",data);} virtual void func(int data) const{printf("A2 :%d/n",data);} void func(char *str){printf("A3 :(%s)/n",str)
Time of Update: 2018-12-03
greenplum是一個分散式資料庫,底下有很多的postgresql的資料庫,我們有時候需要知道底層節點在幹些什麼,能否直接在master上有一個視圖,或者sql,可以看到底下每個節點的sql,並且可以標識出是哪一個機器,哪一個連接埠的資料庫,下面介紹方法:3.3跟4.0的架構有所改變,所以方法也不一樣。1.建立v_active_sql視圖方便查看sql:CREATE VIEW v_active_sql ASSELECT pg_stat_activity.procpid,
Time of Update: 2018-12-03
我發現一直理解錯了,我一直以為分布式索引和分布式搜尋是兩個不同的事情,其實是一樣的.把索引分布在多台電腦上,不就是正好實現了分布式搜尋嗎?既然索引已經分布式儲存了,,因為搜尋就是基於索引的,那搜尋就自然是分布式的啦。.前面看網上一些理解,一直以為分布式索 引和分布式搜尋是兩個獨立分開的過程,不知道理解的對不對? 調研了一下,發現索引檔案的資料結構相當複雜,這個好像是每提交一次建索引,就會將以前已產生的索引重新組織,而且還會產生新檔案,所以如果採用在HDFS中追加寫索引檔案,那工作量將相當大,必
Time of Update: 2018-12-03
這篇部落客要討論如何進行有效時間管理、如何培養良好的習慣,如果感興趣,請繼續往下讀,相信你能從中收穫到很多。 寫這篇文章主要因為下面這幾個小故事: 1. 暑假的時候在百度實習,緊張的節奏,良好的技術氛圍的讓我非常興奮。但在工作了一段時間後,發現自己老是有做不完的事情,只能一直在公司,晚上很晚才能回去。女朋友也經常抱怨不給她打電話。之前還覺得她不理解自己,自己工作這麼認真怎麼不知道體貼呢。
Time of Update: 2018-12-03
__cdecl __fastcall與 __stdcall 呼叫慣例: __cdecl __fastcall與 __stdcall,三者都是呼叫慣例(Calling convention),它決定以下內容:1)函數參數的壓棧順序,2)由調用者還是被調用者把參數彈出棧,3)以及產生函數修飾名的方法。 1、__stdcall呼叫慣例:函數的參數自右向左通過棧傳遞,被調用的函數在返回前清理傳送參數的記憶體棧,
Time of Update: 2018-12-03
在Mahout_in_Action這本書中,給了一個文本的聚類執行個體,並提供了原始輸入資料,下面結合例子說明 作為聚類演算法的主要應用情境 - 文本分類,對文本資訊的建模也是一個常見的問題。在資訊檢索研究領域已經有很好的建模方式,就是資訊檢索領域中最常用的向量空間模型詞頻 - 逆向文本頻率 (Term Frequency – Inverse Document Frequency, TF-IDF):它是對 TF
Time of Update: 2018-12-03
不知道為什麼在Nutch-1.3中沒了Nutch內建的搜尋war檔案,而且在Nutch-1.3中,抓取檔案後,產生的目錄只有crawldb,linkdb,segments,而沒有了indexs和index目錄查了一下官網Wiki,上面是把Nutch的索引映射到solr,用solr來提供搜尋功能,詳見官網Wiki說明:http://wiki.apache.org/nutch/RunningNutchAndSolr我百思不得其解,我覺得Nutch-1.2中內建的搜尋功能挺好用的啊,搜尋介面和百度、G