Time of Update: 2018-12-07
1. 問題 之前我們討論的PCA、ICA也好,對樣本資料來言,可以是沒有類別標籤y的。回想我們做迴歸時,如果特徵太多,那麼會產生不相關特徵引入、過度學習等問題。我們可以使用PCA來降維,但PCA沒有將類別標籤考慮進去,屬於無監督的。 比如回到上次提出的文檔中含有“learn”和“study”的問題,使用PCA後,也許可以將這兩個特徵合并為一個,降了維度。但假設我們的類別標籤y是判斷這篇文章的topic是不是有關學習方面的。那麼這兩個特徵對y幾乎沒什麼影響,完全可以去除。
Time of Update: 2018-12-07
4. 執行個體 將3維空間上的球體樣本點投影到二維上,W1相比W2能夠獲得更好的分離效果。 PCA與LDA的降維對比: PCA選擇樣本點投影具有最大方差的方向,LDA選擇分類效能最好的方向。 LDA既然叫做線性判別分析,應該具有一定的預測功能,比如新來一個範例x,如何確定其類別? 拿二值分來來說,我們可以將其投影到直線上,得到y,然後看看y是否在超過某個閾值y0,超過是某一類,否則是另一類。而怎麼尋找這個y0呢?
Time of Update: 2018-12-07
【pdf版本】因子分析1 問題 之前我們考慮的訓練資料中範例的個數m都遠遠大於其特徵個數n,這樣不管是進行迴歸、聚類等都沒有太大的問題。然而當訓練範例個數m太小,甚至m<<n的時候,使用梯度下降法進行迴歸時,如果初值不同,得到的參數結果會有很大偏差(因為方程數小於參數個數)。另外,如果使用多元高斯分布(Multivariate Gaussian distribution)對資料進行擬合時,也會有問題。讓我們來演算一下,看看會有什麼問題:多元高斯分布的參數估計公式如下:
Time of Update: 2018-12-07
[pdf版本]增強學習.pdf 在之前的討論中,我們總是給定一個樣本x,然後給或者不給label y。之後對樣本進行擬合、分類、聚類或者降維等操作。然而對於很多序列決策或者控制問題,很難有這麼規則的樣本。比如,四足機器人的控制問題,剛開始都不知道應該讓其動那條腿,在移動過程中,也不知道怎麼讓機器人自動找到合適的前進方向。
Time of Update: 2018-12-07
[pdf版本] 典型相關分析.pdf1. 問題 線上性迴歸中,我們使用直線來擬合樣本點,尋找n維特徵向量X和輸出結果(或者叫做label)Y之間的線性關係。其中,。然而當Y也是多維時,或者說Y也有多個特徵時,我們希望分析出X和Y的關係。 當然我們仍然可以使用迴歸的方法來分析,做法如下: 假設,,那麼可以建立等式Y=AX如下 其中,形式和線性迴歸一樣,需要訓練m次得到m個。
Time of Update: 2018-12-07
[pdf版本]偏最小二乘法迴歸.pdf1. 問題 這節我們請出最後的有關成分分析和迴歸的神器PLSR。PLSR感覺已經把成分分析和迴歸發揮到極致了,下面主要介紹其思想而非完整的教程。讓我們回顧一下最早的Linear Regression的缺點:如果範例數m相位元征數n少(m<n)或者特徵間線性相關時,由於(n*n矩陣)的秩小於特徵個數(即無法復原)。因此最小二乘法就會失效。
Time of Update: 2018-12-07
文章目錄 基於Spark-0.4和Hadoop-0.20.2 基於Spark-0.4和Hadoop-0.20.21. Kmeans資料:自己產生的三維資料,分別圍繞正方形的8個頂點{0, 0, 0}, {0, 10, 0}, {0, 0, 10}, {0, 10, 10},{10, 0, 0}, {10, 0, 10}, {10, 10, 0}, {10, 10, 10}Point number189,918,082 (1億9千萬個三維點)
Time of Update: 2018-12-07
訪問者(Visitor)模式
Time of Update: 2018-12-07
1. 問題: 1、上節提到的PCA是一種資料降維的方法,但是只對符合高斯分布的樣本點比較有效,那麼對於其他分布的樣本,有沒有主元分解的方法呢? 2、經典的雞尾酒宴會問題(cocktail party
Time of Update: 2018-12-07
7. ICA演算法擴充描述 上面介紹的內容基本上是講義上的,與我看的另一篇《Independent Component Analysis:Algorithms and Applications》(Aapo Hyvärinen and Erkki Oja)有點出入。下面總結一下這篇文章裡提到的一些內容(有些我也沒看明白)。 首先裡面提到了一個與“獨立”相似的概念“不相關(uncorrelated)”。Uncorrelated屬於部分獨立,而不是完全獨立,怎麼刻畫呢?
Time of Update: 2018-12-07
選擇排序、快速排序、希爾排序、堆排序不是穩定的排序演算法,冒泡排序、插入排序、歸併排序和基數排序是穩定的排序演算法。冒泡法: 這是最原始,也是眾所周知的最慢的演算法了。他的名字的由來因為它的工作看來象是冒泡:
Time of Update: 2018-12-07
演算法導論上2-4是這樣一個題目:設A[1...n]是一個包含n個不同數的數組。如果在i<j的情況下,有A[i]>A[j],則(i, j)就稱為A中的一個逆序對(inversion)。試給出一個演算法,它能用O(nlgn)的最壞情況已耗用時間確定n個元素的任何排列中逆序對的數目。咋一看沒有什麼思路,可一看見提示赫然給出:修改歸併排序,於是頓悟。其實,只需要在歸併排序中加上一個計數器,在每次merge的時候計算逆序對,這樣就可以算出總共的逆序對了。#include
Time of Update: 2018-12-07
Find The MultipleTime Limit: 1000MSMemory Limit:10000KTotal Submissions: 10604Accepted: 4373Special JudgeDescriptionGiven a positive integer n, write a program to find out a nonzero multiple m of n whose decimal representation contains only the
Time of Update: 2018-12-07
這個問題來自演算法導論的習題9.1-1.問題是這樣的:證明:在最壞情況下,利用n+[lgn]-2次比較,即可找到n個元素中的第二小元素。證明:構造出這種比較方法就可以了。看見lgn就應該想到配對。實際上,將n個元素兩兩分組進行比較,選取每次比較中的較小元素,這樣一來,可以一直做下去直到得到最小元素,這需要n-1次比較。將想原來做到的淘汰賽問題,一場比賽淘汰一支球隊,一共就需要n-1場比賽決出冠軍。接下來,次小的元素肯定是和最小元素比較過的,回溯與最小元素比較過的元素,最壞情況下需要二叉樹的高度這
Time of Update: 2018-12-07
Prime PathTime Limit: 1000MSMemory Limit:65536KTotal Submissions: 6713Accepted:3808DescriptionThe ministers of the cabinet were quite upset by the message from the Chief of Security stating that they would all have to change the four-digit room
Time of Update: 2018-12-07
菜B也有這一天。被一個素不相識的人叫上準備組隊參加比賽。叫上D。也算是有個一個隊伍,一個組織。一直以來,自己總是逃避些什麼,猥瑣在自己的comfort zone,耗費著光陰。沒有曆練的青春難免黯淡。參加比賽,不為什麼,為的是給自己一個奮鬥的鞭策,讓蹂躪來得更猛烈些吧!!已經這把年紀,著實不早了,但如果若干年後我回顧的時候更夠自豪地說:“其實也不算太晚!”那麼,mission accomplished!
Time of Update: 2018-12-07
關於補碼,微機原理這門課裡面詳細地敘述過,今天來是因為這個自己有些遺忘的細節。對於n位二進位表示的碼字,補碼的公式定義是:2^n+這個數 然後用二進位表示。比如:考慮n=8,對於正數15,補碼應該是:2^8+15=00001111 對於負數-15,補碼應該是:2^8-15=11110001 對於負數-128,補碼應該是:2^8+(-2^7)=10000000
Time of Update: 2018-12-07
今天在使用MATLAB的過程中遇見一個詭異的問題。首先我定義一個矩陣a。>> a = [2 0 5 6;1 3 3 6;-1 1 2 1;1 0 1 3 ]a = 2 0 5 6 1 3 3 6 -1 1 2 1 1 0 1 3然後求逆。>> b = inv(a)b = 0.4444 0.3333 -1.0000 -1.2222
Time of Update: 2018-12-07
在台上唱歌,最牛逼的不是唱完後觀眾熱烈的掌聲,而是開始歌唱時整個喧囂的人群瞬間安靜下來,靜靜地聆聽。----anonymous問題Young氏矩陣是滿足這樣性質的m*n矩陣,它其中每一行的資料都從左至右排序,每一列的資料都從上到下排序。Young氏矩陣會有一些∞資料項目,表示不存在的元素。所以,Young氏矩陣可以用來存放人r<=mn個有限的數。就是一個Young氏矩陣的例子。給出在一個非空m*n的Young氏矩陣上實現EXTRACT-MIN的演算法,使其已耗用時間為O(m+n)。定義T(
Time of Update: 2018-12-07
職責鏈(Chain of