線性判別分析(Linear Discriminant Analysis)(一)

1. 問題     之前我們討論的PCA、ICA也好,對樣本資料來言,可以是沒有類別標籤y的。回想我們做迴歸時,如果特徵太多,那麼會產生不相關特徵引入、過度學習等問題。我們可以使用PCA來降維,但PCA沒有將類別標籤考慮進去,屬於無監督的。     比如回到上次提出的文檔中含有“learn”和“study”的問題,使用PCA後,也許可以將這兩個特徵合并為一個,降了維度。但假設我們的類別標籤y是判斷這篇文章的topic是不是有關學習方面的。那麼這兩個特徵對y幾乎沒什麼影響,完全可以去除。    

線性判別分析(Linear Discriminant Analysis)(二)

4. 執行個體      將3維空間上的球體樣本點投影到二維上,W1相比W2能夠獲得更好的分離效果。            PCA與LDA的降維對比:            PCA選擇樣本點投影具有最大方差的方向,LDA選擇分類效能最好的方向。      LDA既然叫做線性判別分析,應該具有一定的預測功能,比如新來一個範例x,如何確定其類別?      拿二值分來來說,我們可以將其投影到直線上,得到y,然後看看y是否在超過某個閾值y0,超過是某一類,否則是另一類。而怎麼尋找這個y0呢?     

因子分析(Factor Analysis)

【pdf版本】因子分析1 問題     之前我們考慮的訓練資料中範例的個數m都遠遠大於其特徵個數n,這樣不管是進行迴歸、聚類等都沒有太大的問題。然而當訓練範例個數m太小,甚至m<<n的時候,使用梯度下降法進行迴歸時,如果初值不同,得到的參數結果會有很大偏差(因為方程數小於參數個數)。另外,如果使用多元高斯分布(Multivariate Gaussian distribution)對資料進行擬合時,也會有問題。讓我們來演算一下,看看會有什麼問題:多元高斯分布的參數估計公式如下:    

增強學習(Reinforcement Learning and Control)

 [pdf版本]增強學習.pdf     在之前的討論中,我們總是給定一個樣本x,然後給或者不給label y。之後對樣本進行擬合、分類、聚類或者降維等操作。然而對於很多序列決策或者控制問題,很難有這麼規則的樣本。比如,四足機器人的控制問題,剛開始都不知道應該讓其動那條腿,在移動過程中,也不知道怎麼讓機器人自動找到合適的前進方向。    

典型關聯分析(Canonical Correlation Analysis)

[pdf版本] 典型相關分析.pdf1. 問題      線上性迴歸中,我們使用直線來擬合樣本點,尋找n維特徵向量X和輸出結果(或者叫做label)Y之間的線性關係。其中,。然而當Y也是多維時,或者說Y也有多個特徵時,我們希望分析出X和Y的關係。      當然我們仍然可以使用迴歸的方法來分析,做法如下:      假設,,那麼可以建立等式Y=AX如下            其中,形式和線性迴歸一樣,需要訓練m次得到m個。     

偏最小二乘法迴歸(Partial Least Squares Regression)

[pdf版本]偏最小二乘法迴歸.pdf1. 問題     這節我們請出最後的有關成分分析和迴歸的神器PLSR。PLSR感覺已經把成分分析和迴歸發揮到極致了,下面主要介紹其思想而非完整的教程。讓我們回顧一下最早的Linear Regression的缺點:如果範例數m相位元征數n少(m<n)或者特徵間線性相關時,由於(n*n矩陣)的秩小於特徵個數(即無法復原)。因此最小二乘法就會失效。    

Hadoop vs Spark效能對比

文章目錄 基於Spark-0.4和Hadoop-0.20.2 基於Spark-0.4和Hadoop-0.20.21. Kmeans資料:自己產生的三維資料,分別圍繞正方形的8個頂點{0, 0, 0}, {0, 10, 0}, {0, 0, 10}, {0, 10, 10},{10, 0, 0}, {10, 0, 10}, {10, 10, 0}, {10, 10, 10}Point number189,918,082 (1億9千萬個三維點)

訪問者(Visitor)模式

訪問者(Visitor)模式

獨立成分分析(Independent Component Analysis)

1. 問題:     1、上節提到的PCA是一種資料降維的方法,但是只對符合高斯分布的樣本點比較有效,那麼對於其他分布的樣本,有沒有主元分解的方法呢?     2、經典的雞尾酒宴會問題(cocktail party

ICA擴充描述

7. ICA演算法擴充描述     上面介紹的內容基本上是講義上的,與我看的另一篇《Independent Component Analysis:Algorithms and Applications》(Aapo Hyvärinen and Erkki Oja)有點出入。下面總結一下這篇文章裡提到的一些內容(有些我也沒看明白)。     首先裡面提到了一個與“獨立”相似的概念“不相關(uncorrelated)”。Uncorrelated屬於部分獨立,而不是完全獨立,怎麼刻畫呢?    

zz排序演算法的穩定性

選擇排序、快速排序、希爾排序、堆排序不是穩定的排序演算法,冒泡排序、插入排序、歸併排序和基數排序是穩定的排序演算法。冒泡法:  這是最原始,也是眾所周知的最慢的演算法了。他的名字的由來因為它的工作看來象是冒泡: 

歸併排序與逆序對

演算法導論上2-4是這樣一個題目:設A[1...n]是一個包含n個不同數的數組。如果在i<j的情況下,有A[i]>A[j],則(i, j)就稱為A中的一個逆序對(inversion)。試給出一個演算法,它能用O(nlgn)的最壞情況已耗用時間確定n個元素的任何排列中逆序對的數目。咋一看沒有什麼思路,可一看見提示赫然給出:修改歸併排序,於是頓悟。其實,只需要在歸併排序中加上一個計數器,在每次merge的時候計算逆序對,這樣就可以算出總共的逆序對了。#include

poj 1426 BFS

Find The MultipleTime Limit: 1000MSMemory Limit:10000KTotal Submissions: 10604Accepted: 4373Special JudgeDescriptionGiven a positive integer n, write a program to find out a nonzero multiple m of n whose decimal representation contains only the

最小值和第二小值

這個問題來自演算法導論的習題9.1-1.問題是這樣的:證明:在最壞情況下,利用n+[lgn]-2次比較,即可找到n個元素中的第二小元素。證明:構造出這種比較方法就可以了。看見lgn就應該想到配對。實際上,將n個元素兩兩分組進行比較,選取每次比較中的較小元素,這樣一來,可以一直做下去直到得到最小元素,這需要n-1次比較。將想原來做到的淘汰賽問題,一場比賽淘汰一支球隊,一共就需要n-1場比賽決出冠軍。接下來,次小的元素肯定是和最小元素比較過的,回溯與最小元素比較過的元素,最壞情況下需要二叉樹的高度這

poj 3126 BFS

Prime PathTime Limit: 1000MSMemory Limit:65536KTotal Submissions: 6713Accepted:3808DescriptionThe ministers of the cabinet were quite upset by the message from the Chief of Security stating that they would all have to change the four-digit room

準備打醬油…

菜B也有這一天。被一個素不相識的人叫上準備組隊參加比賽。叫上D。也算是有個一個隊伍,一個組織。一直以來,自己總是逃避些什麼,猥瑣在自己的comfort zone,耗費著光陰。沒有曆練的青春難免黯淡。參加比賽,不為什麼,為的是給自己一個奮鬥的鞭策,讓蹂躪來得更猛烈些吧!!已經這把年紀,著實不早了,但如果若干年後我回顧的時候更夠自豪地說:“其實也不算太晚!”那麼,mission accomplished!

補碼拾遺

關於補碼,微機原理這門課裡面詳細地敘述過,今天來是因為這個自己有些遺忘的細節。對於n位二進位表示的碼字,補碼的公式定義是:2^n+這個數 然後用二進位表示。比如:考慮n=8,對於正數15,補碼應該是:2^8+15=00001111                     對於負數-15,補碼應該是:2^8-15=11110001                     對於負數-128,補碼應該是:2^8+(-2^7)=10000000

MATLAB的分數和小數

今天在使用MATLAB的過程中遇見一個詭異的問題。首先我定義一個矩陣a。>> a = [2 0 5 6;1 3 3 6;-1 1 2 1;1 0 1 3 ]a =     2     0     5     6     1     3     3     6    -1     1     2     1     1     0     1     3然後求逆。>> b = inv(a)b =    0.4444    0.3333   -1.0000   -1.2222

young矩陣學習

在台上唱歌,最牛逼的不是唱完後觀眾熱烈的掌聲,而是開始歌唱時整個喧囂的人群瞬間安靜下來,靜靜地聆聽。----anonymous問題Young氏矩陣是滿足這樣性質的m*n矩陣,它其中每一行的資料都從左至右排序,每一列的資料都從上到下排序。Young氏矩陣會有一些∞資料項目,表示不存在的元素。所以,Young氏矩陣可以用來存放人r<=mn個有限的數。就是一個Young氏矩陣的例子。給出在一個非空m*n的Young氏矩陣上實現EXTRACT-MIN的演算法,使其已耗用時間為O(m+n)。定義T(

職責鏈(Chain of Responsibility)模式

職責鏈(Chain of

總頁數: 61357 1 .... 6630 6631 6632 6633 6634 .... 61357 Go to: 前往

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.