Time of Update: 2018-12-07
1. 特徵值與特徵向量矩陣作用於向量的特殊情況是它能等價於用一個常數作用於該向量。,其中稱為特徵向量,稱為對應於的特徵向量,是非0向量。是A的特徵值若且唯若 有非平凡解。 不同特徵值對應的特徵向量構成的集合線性無關。 對角化 很多情況下A可以做這樣的分解D是對角矩陣,這樣可以方便求解 。考慮如果A有n個線性無關的特徵向量。 ,其中P由這個n個向量組成,D是對應對角線上取相對應的特徵值。如果不是有n個不同的特徵值,但是所有特徵值對應的特徵向量空間維數之和為n也可以。 2.
Time of Update: 2018-12-07
從我小站轉過來的,已經“犧牲”了,就放這吧,是我學習Hadoop中的一些心得。 HDFS是一個不錯的Distributed File
Time of Update: 2018-12-07
還是原小站的東西,學習Hadoop的一些心得,扔這裡保管先吧。 HDFS也有塊(Block)的概念,但它的塊是一個很大的單元,預設是64MB。像硬碟中的檔案系統一樣,在HDFS中的檔案將會按塊大小進行分解,並作為獨立的單元進行儲存。但和硬碟中的檔案系統不一樣的是,儲存在塊中的一個比塊小的檔案並不會佔據一個塊大小的硬碟物理空間(HDFS中一個塊只儲存一個檔案的內容)。 那為什麼HDFS中的塊如此之大呢? HDFS的塊之所以這麼大,主要原因就是為了把尋道(Seek)時間最小化。如果一個塊足
Time of Update: 2018-12-07
來自原小站,技術含量≈0,翻譯整理自Hadoop-The Definitive Guide。Pig是yahoo捐獻給apache的一個項目,它是SQL-like語言,是在MapReduce上構建的一種進階查詢語言,把一些運算編譯進MapReduce模型的Map和Reduce中,並且使用者可以定義自己的功能。這是Yahoo開發的又一個複製Google的項目:Sawzall。Pig是一個用戶端應用程式,就算你要在Hadoop叢集上運行Pig,也不需要在叢集上裝額外的東西。Pig的安裝是灰常的簡單的:
Time of Update: 2018-12-07
我們論壇出的第一期Hadoop電子雜誌, 歡迎大家下載. 目錄1 Hadoop介紹2 Hadoop在國內應用情況3 Hadoop原始碼eclipse編譯教程7 在Windows上安裝Hadoop教程13 在Linux上安裝Hadoop教程19 在Windows上使用eclipse編寫Hadoop應用程式24 在Windows中使用Cygwin安裝HBase28 Nutch 與Hadoop的整合與部署3
Time of Update: 2018-12-07
A Note on the Expectation-Maximization(EM) AlgorithmChengXiang Zhai 的一篇EM演算法note。/Files/rocketfan/em-note.pdf1. 簡介KMEAS演算法就是一種EM演算法,比如要給所有的點聚類成兩組,那麼先隨機取兩個點作為中心,然後將所有點按照距離這兩個點的聚類分類到這兩個點上,分成兩組,然後每個組再計算中心,利用中心再重複分組。。
Time of Update: 2018-12-07
文章目錄 這個推導很牛,因為這樣log(a+b…)即log裡面的+就木有了!演算法為什麼收斂E step is easyM step Andrew Ng 關於EM有兩個不錯的課件http://www.stanford.edu/class/cs229/notes/cs229-notes7b.pdf Mixtures of Gaussians and the EM
Time of Update: 2018-12-07
今天給家裡購置了一台TP-LINK的無線路由器,想在家裡組建一個無線區域網路。但原來家裡已經有了一個整合Modem加路由的有線路由器了,所以得跟它串連起來混合使用。剛開始忘了咋配置了,先是自己折騰了下,但折騰不出來。只好上網查了,但不知是我倒黴還是咋滴,看到的配置到我手裡配了就是不成功(後來發現是自己折騰暈了,有些配置好了的時候,沒插網線到有線路由器~~)!經過一些折騰,最終還是折騰好了,現在就躺在床上寫呢。。。老人一個了,記性不好,記錄一下,備用。首先,表上網路拓撲圖:
Time of Update: 2018-12-07
stanford的NLP課件是一個比較好的總結這裡記錄下。http://www.stanford.edu/class/cs224n/handouts/fsnlp-em-slides.pdfMLE 又一個不同的應用情境,但是可以看出基本都是mixture… 引入hidden variable讓計算變的容易,因為確定了具體哪個part model產生 這個推導看前面的總結 關鍵詞 下面是這個課件專屬的,EM made
Time of Update: 2018-12-07
由於在Ubuntu系統中,程式預設啟動都是顯示在左上方的,這樣我就經常需要把它拉回到中間來。但是在拉的過程中我經常會觸碰到頂上隱藏的Panel(已設定自動隱藏),當然在平時由於操作習慣,我也會經常觸發頂上隱藏的Panel。平時就忍著忍著過了,今日實在心癢就想把頂上的那個Panel換到其它地方去,但換左換右都是感覺不太舒服。就在這時,悲劇的事情發生了,我選擇了放置在下方(原來下方已有一個固定的Panel,就相當於Win的工作列了),瞬間,頂上的Panel切到了下面,接著自動隱藏,接著。。。系統
Time of Update: 2018-12-07
文章目錄 基本參數進階參數 最近看到調度器這一塊,發現Hadoop官方文檔中有關公平調度器(Fair Scheduler Guide)和容量調度器(Capacity Scheduler Guide)部分的文檔還沒有漢化,Google了下也未發現有相關漢化,So,我班門弄斧,拋磚引玉一下了。這裡先奉上公平調度器的中文版。由於我一直用Cloudera Hadoop
Time of Update: 2018-12-07
主要記錄下幾個文章部落格內容A Note on EM Algorithm for Probabilistic Latent SemanticAnalysis(翟成祥的NOTE)A Note on EM Algorithm and PLSA(一個中文比較好的總結 by Xinyan Lu)注意這兩個是一個思路Probabilistic Latent Semantic Analysis (原論文)原論文是另一個思路Notes on Probabilistic Latent Semantic
Time of Update: 2018-12-07
目錄 1、Hadoop 業界資訊......................................... - 1 - 2、Nutch + Hadoop 構建商用分布式搜尋引擎的問題探究 ....... - 5 -3、支援自訂爬蟲的Nutch segment 檔案儲存體介面改寫.......... - 11 - 4、Nutch 中mapreduce 應用的幾個特殊點 .................... - 14 - 5、Java RMI + Lucene
Time of Update: 2018-12-07
來自原小站,曾經迷糊過的東西,表上來,希望對正在迷糊或即將迷糊的人有協助。 談到系統的延展性,Scale-up(縱向擴充)和Scale-out(橫向擴充)是兩個常見的術語,對於初學者來說,很容易搞迷糊這兩個概念,這裡總結了一些把概念解釋的比較清楚的內容。 首先來段Wikipedia的,講的很透徹了。 Scale vertically (scale up) To scale vertically (or scale up) means to add resources to
Time of Update: 2018-12-07
決定系統學習下機器學習了,以stanford課件為主線。notes1是關於迴歸的部分http://www.stanford.edu/class/cs229/notes/cs229-notes1.pdf 1.線性迴歸舉例是對於房子價格的預測,它這個資料很遺憾網上找不到,那麼就暫時用5個資料點做下實驗吧。準備house.txt,5個資料記錄大小,臥室數目,價格。area bedrooms price2104 3 4001600 3 3302400 3
Time of Update: 2018-12-07
在上一篇文章中我們講解了一個基本的MapReduce作業由那些基本組件組成,從高層來看,所有的組件在一起工作時如所示:圖4.4高層MapReduce工作流程水線 MapReduce的輸入一般來自HDFS中的檔案,這些檔案分布儲存在叢集內的節點上。運行一個MapReduce程式會在叢集的許多節點甚至所有節點上運行mapping任務,每一個mapping任務都是平等的:mappers沒有特定“標識物”與其關聯。因此,任意的mapper都可以處理任意的輸入檔案。每一個mapper會載入一些儲存在
Time of Update: 2018-12-07
額外的MapReduce功能 圖4.6 插入了Combiner的MapReduce資料流 Combiner:前面展示的流水線忽略了一個可以最佳化MapReduce作業所使用頻寬的步驟,這個過程叫Combiner,它在Mapper之後Reducer之前運行。Combiner是可選的,如果這個過程適合於你的作業,Combiner執行個體會在每一個運行map任務的節點上運行。Combiner會接收特定節點上的Mapper執行個體的輸出作為輸入,接著Combiner的輸出會被發送到Reducer那裡,
Time of Update: 2018-12-07
1. 線性擬合問題的迭代解法batch gradient descent梯度下降法,每次沿著梯度方向對於參數移動小的距離。 有兩種具體實現,一種是每次移動的時候考慮所有的實驗點,這種在訓練集合較大的時候開銷比較大。(如下,每次掃描所有m個實驗點) 另外一種是stochastic gradient deseent掃描每個點的時候就決定了參數的按照該點的梯度進行參數調整。即每次參數調整隻考慮當前一個實驗點。這個收斂速度會更快,但是不保證能收斂到最佳,但是如果逐步調小的值可以收斂到最佳。
Time of Update: 2018-12-07
1. 伯努利分布 現在問題是假如我們考慮拋硬幣,如果3次都是head,那麼根據伯努利,MLE推斷 參數 那麼我們會認為每次投擲都會是head,這顯然與常識不符,這裡我們如果有一個先驗知識就能糾正這個問題(考慮貝葉斯分類器中的0機率事件處理其實也是加一個先驗知識而已來進行平滑),那麼怎麼加入先驗知識呢? 這裡我們利用貝葉斯法則,我們從原來的 來估算參數,改為後驗 也即等價 估算參數。這裡我們希望 有類似的形式。從而引出了beta 分布,注意與(先驗)的形式類似,只不過(a,b)變成(m+a,
Time of Update: 2018-12-07
n元ngram模型本質上就是trie樹的結構,逐層狀態轉移。在sun拼音中是採用的是逐層按照順序用vector表示,尋找的時候逐層二分尋找。sun拼音的建立ngram模型的方法也是以按照字典序排好序的<ngram元組,次數>序列作為輸入建立起來的。利用順序儲存+二分尋找應該是最節省空間的了。但是效率要受一定影響。其餘的trie樹實現包括可以利用map(hash_map更耗費空間一點),sun拼音也有一個基於map的trie樹實現,sirlm是利用自己的一個LHash實現的類似。另外利