標籤:style blog http color os 資料 art ar
本文出處:http://blog.csdn.net/xizhibei
=============================
PCA,也就是PrincipalComponents Analysis,主成份分析,是個非常優秀的演算法,依照書上的說法:
尋找最小均方意義下,最能代表未經處理資料的投影方法
然後自己的說法就是:主要用於特徵的降維
另外,這個演算法也有一個經典的應用:Face Service。這裡略微扯一下,無非是把處理好的人臉圖片的每一行湊一起作為特徵向量,然後用PAC演算法降維搞定之。
PCA的主要思想是尋找到資料的主軸方向,由主軸構成一個新的座標系,這裡的維數能夠比原維數低,然後資料由原座標系向新的座標系投影,這個投影的過程就能夠是降維的過程。
推導過程神馬的就不扯了,推薦一個課件:http://www.cs.otago.ac.nz/cosc453/student_tutorials/principal_components.pdf,講得挺具體的
然後說下演算法的步驟
1.計算全部樣本的均值m和散布矩陣S,所謂散布矩陣同共變數矩陣;
2.計算S的特徵值,然後由大到小排序;
3.選擇前n‘個特徵值相應的特徵向量作成一個變換矩陣E=[e1, e2, …, en’];
4.最後,對於之前每個n維的特徵向量x能夠轉換為n’維的新特徵向量y:
y = transpose(E)(x-m)
最後還得親自做下才幹記得住:用Python的numpy做的,用C做的話那就是沒事找事,太費事了,由於對numpy不熟,以下可能有錯誤,望各位大大指正
mat = np.load("data.npy")#每一行一個類別數字標記與一個特徵向量data = np.matrix(mat[:,1:])avg = np.average(data,0)means = data - avgtmp = np.transpose(means) * means / N #N為特徵數量D,V = np.linalg.eig(tmp)#DV分別相應特徵值與特徵向量組成的向量,須要注意下的是,結果是自己主動排好序的,再次膜拜numpy OTL#print V#print DE = V[0:100,:]#這裡僅僅是簡單取前100維資料,實際情況能夠考慮取前80%之類的y = np.matrix(E) * np.transpose(means)#得到降維後的特徵向量np.save("final",y)
另外,須要提一下的是OpenCV(無所不能的OpenCV啊OTL)中有PCA的實現:
void cvCalcPCA( const CvArr* data,//輸入資料 CvArr* avg, //平均(輸出)CvArr* eigenvalues, //特徵值(輸出)CvArr* eigenvectors, //特徵向量(輸出)int flags );//輸入資料中的特徵向量是怎麼放的,比方CV_PCA_DATA_AS_ROW
最後,說下PCA的缺點:PCA將全部的樣本(特徵向量集合)作為一個總體對待,去尋找一個均方誤差最小意義下的最優線性映射投影,而忽略了類別屬性,而它所忽略的投影方向有可能剛好包括了重要的可分性資訊
嗯,最後的最後——好了,沒了,的確是最後了
強烈推薦:一篇能把PAC說得非常透徹的文章《特徵向量物理意義》:http://blog.sina.com.cn/s/blog_49a1f42e0100fvdu.html