Time of Update: 2018-12-04
分析問題:假設存在一個長度為 N 的子串 S 出現的次數最多。那麼它具有哪些特點呢?S 的任一子串的出現次數不少於 S 的出現次數S 中不會出現重複的子串字元S 中不會出現重複的字元組成 S 的每一個字元、每一個子串的出現次數都和 S 一樣解決問題:掃描輸入的每個字元,記錄每個字元 C 的出現次數,以及對該字元的後續字元 NC 的關聯次數。掃描統計資料中每個字元的出現次數,找出最大值 M。再次掃描統計資料,把出現次數滿足 M 的字元 C 放入集合 RS 中。如果 C 存在同樣滿足 M
Time of Update: 2018-12-04
1、成員函數的實現機制和普通(全域)函數沒有本質區別,對編譯器而言,經過名稱處理以後(在函數名前加上命名空間、類名),一個成員函數就是普通函數了,在編譯後的代碼地區有確定的函數體和入口地址。最大的差別在於發生調用時,對於成員函數,編譯器會隱含語句push this,其中this指標指向對象的地址,這就是操作所需要的資料的所在。編譯後的成員函數調用可能是:...push thiscall
Time of Update: 2018-12-04
Nutch 1.3 學習筆記 7 CrawlDb - updatedb------------------------------這裡主要看一下CrawlDb中的updatedb,它主要是用來更新CrawlDb資料庫的1. bin/nutch updatedb我們用nutch的命令列時會看到一個方法叫updatedb,其實這個方法就是調用CrawlDb.java類中的update方法,它的參數協助如下:Usage: CrawlDb <crawldb> (-dir
Time of Update: 2018-12-04
一、簡介1. Nutch是一個基於Hadoop和Lucene的一個網路爬行器,用於收集網頁資訊。2. 特點:基於Plugin機制以提高可擴充性;多協議和多線程分布式抓取;基於外掛程式的內容分析機制;強大的抓取預先處理控制;可擴充的資料處理模型(mapReduce);全文索引器和搜尋引擎(Lucene or Solor),支援分散式查詢;強大的API和整合配置。 二、一些必須的配置1. Nutch 1.2版本,ubuntu 10.01 xfce2.
Time of Update: 2018-12-04
Nutch 1.3 學習筆記 9 SolrIndexer----------------------------------新的Nutch使用了Solr來做了背景索引服務,nutch正在努力與Solr進行更方便的整合,它很好的與Solr處理了耦合關係,把Solr當成一個服務,Nutch只要調用其用戶端就可以與其進行通訊。1. bin/nutch solrindex 這個命令是用來對抓取下來的內容建立索引,協助如下: Usage: SolrIndexer <solr url>
Time of Update: 2018-12-04
按天拆分資料的一個預存程序:create or replace procedure lk_migrate iscursor cur1 is select id,to_date(l.validfrom,'YYYY-MM-DD') startday,to_date(l.validto,'YYYY-MM-DD') quitday from solution l;n number;k number;m number:=0;begin for i in cur1 loop
Time of Update: 2018-12-04
二叉排序樹(二叉尋找樹,Binary Sort Tree):它或者是一棵空樹;或者是具有下列性質的二叉樹: (1)若左子樹不空,則左子樹上所有結點的值均小於它的根結點的值; (2)若右子樹不空,則右子樹上所有結點的值均大於它的根結點的值; (3)左、右子樹也分別為二叉排序樹;平衡二叉樹(AVL樹):它或者是一棵空樹或它的左右兩個子樹的高度差的絕對值不超過1,並且左右兩個子樹都是一棵平衡二叉樹。紅/黑樹狀結構(RB樹):性質1. 節點是紅色或黑色。 性質2. 根是黑色。 性質3
Time of Update: 2018-12-04
(1).視窗機制 滑動視窗協議的基本原理就是在任意時刻,發送方都維持了一個連續的允許發送的幀的序號,稱為發送視窗;同時,接收方也維持了一個連續的允許接收的幀的序號,稱為接收視窗。發送視窗和接收視窗的序號的上下界不一定要一樣,甚至大小也可以不同。不同的滑動視窗協議視窗大小一般不同。發送方視窗內的序號代表了那些已經被發送,但是還沒有被確認的幀,或者是那些可以被發送的幀。下面舉一個例子(假設發送視窗尺寸為2,接收視窗尺寸為1): 分析:①初始態,發送方沒有幀發出,發送視窗前後沿相重合。接收方
Time of Update: 2018-12-04
Nutch 1.3 學習筆記 - Inject----------------------------1. Inject是幹嘛的?在Nutch中Inject是用來把文字格式設定的url列表注入到抓取資料庫中,一般是用來引導系統的初始化。這裡的文字格式設定如下:http://www.nutch.org/ \t nutch.score=10 \t nutch.fetchInterval=2592000 \t
Time of Update: 2018-12-04
動態規劃基本思想是,將原問題分解為相似的子問題,在求解的過程中通過子問題的解求出原問題的解。因此一般有遞推公式將一個問題分解成幾個子問題。任何遞推公式都可以直接翻譯成遞迴演算法,但是基本實現時編譯器往往不能正確對待遞迴演算法,結果產生低效程式,當懷疑是這種情況時,必須給編譯器一些協助,將遞迴演算法寫成非遞迴。也就是把子問題的答案系統的記錄在一個表內,這種技巧就是動態規劃。寫動態規劃規劃程式的關鍵是如何設計這個表:1.表的行和列各代表什麼意思。2.表從哪裡開始填起,如何填。3.最優解在哪個位置。4
Time of Update: 2018-12-04
./client/corelayoutmanager.js下的LayoutManager.prototype.setFooter = function()函數中加入以下內容:var seperator3 = document.createElement("span"); seperator3.innerHTML = " <b>·</b> ";
Time of Update: 2018-12-04
一、安裝依賴代碼: 1、BerkeleyDB 4.6+ 即:libdb4.6++-dev 2、Boost version 1.34.1+, 以及libboost-filesystem-dev 、 libboost-iostreams-dev 、 libboost-program-options-dev、 libboost-python-dev 、 libboost-serialization-dev 3、expat dev
Time of Update: 2018-12-04
Nutch 1.3 學習筆記1--------------------1. Nutch是什麼?Nutch是一個開源的網頁抓取工具,主要用於收集網頁資料,然後對其進行分析,建立索引,以提供相應的介面來對其網頁資料進行查詢的一套工具。其底層使用了Hadoop來做分散式運算與儲存,索引使用了Solr分布式索引架構來做,Solr是一個開源的全文索引架構,從Nutch 1.3開始,其整合了這個索引架構2. 在哪裡要可以下載到最新的Nutch?在下面地址中可以下載到最新的Nutch
Time of Update: 2018-12-04
Debian 5.0.1 xfce4.2 安裝經驗-----------------------------動機:以前用過一段時間Debian,由於其配置比較麻煩,所以掗來一般是用ubuntu的,因為它對硬體的相容性、使用者體驗都比較不錯,但由於本本記憶體不是太大,用了一段時候的xubuntu,發現越來越慢,而且啟動xfce4的速度真是讓人受不了,一般都在2-5分鐘之間,有人說ubuntu= debian+
Time of Update: 2018-12-04
Facebook Scribe介紹-------------------1. 介紹 Scribe是Facebook一個開源的即時分布式日誌收集系統。它提高了大規模日誌收集的可靠性和可擴充性。你可以在不同的節點上安裝Scribe服務,然後這些服務會把收集到的資訊發布到中心的服務叢集上去。當中心服務不可得到時,本地的Scribe服務會暫時把收集到的資訊儲存到本地,等中心服務恢複以後再進行資訊的上傳。中心服務叢集可以把收集到的資訊寫入本地磁碟或者Distributed
Time of Update: 2018-12-04
遷移到Hadoop 0.20.2後的一些感想------------------------------------------------1. 問題:離Hadoop 0.20.2的發布也有三個月了,平時一直在用http://www.cloudera.com/提供的一個Hadoop版本,它也是基於Hadoop 0.18.3開發的,因為它的一個比較穩定的版本。但是最近在用hypertable 0.9.2.7的時候發現我本地jni調用老是會出現Hyperspace COMM already
Time of Update: 2018-12-04
以下是c標準庫中該函數的實現代碼,從中分析要點/*** *atox.c - atoi and atol conversion * * Copyright (c) 1989-1997, Microsoft Corporation. All rights reserved. * *Purpose: * Converts a character string into an int or long. * *************************************************
Time of Update: 2018-12-04
詳細解說STL hash_map系列 詳細解說STL hash_map系列 0 為什麼需要hash_map 1 資料結構:hash_map原理 2 hash_map 使用 2.1 一個簡單一實例 2.2 hash_map 的hash函數 2.3 hash_map 的比較函數 2.4 hash_map 函數 3 相關hash容器 4 其他 4.1 hash_map和map的區別在哪裡? 4.2 什麼時候需要用hash_map,什麼時候需要用map? 4.3
Time of Update: 2018-12-04
昨天下午參加了一個百度技術沙龍的活動,主要講的是雲端運算方面的東西,百度現在也在搞這麼一個平台,類似於google app engine ,他們叫做baidu app engine,不過現在還不夠成熟,所以還沒有開放使用,在內部已經把多重專案遷移到上面。 後面新浪的sae技術經理也將來新浪在雲端運算平台的發展和技術,很多功能已近公開內測,具體應用可以查看http://sae.sina.com.cn/。 亞馬遜雲平台http://aws.amazon.com/
Time of Update: 2018-12-04
void *memcpy(void*dest,const void*src,size_tcount)//1.源串要有const修飾,這裡參數都是void *{ char *pDest=(char*)(dest);//2.將原始指標賦給新變數,char * const char *pSrc=(constchar*)(src); //3.目的地址和源地址重疊,從源地址的末尾方向開始拷貝 if( pDest>pSrc&&