標籤:mina 構造 包括 指定 ring 問題 column padding 應用
幾個分布函數:
PMF(機率品質函數):離散隨機變數在各特定取值上的機率。
PDF(機率密度函數):對連續隨機變數定義,只有對連續隨機變數的取值進行積分後才是機率。
CDF(累積分布函數):能完整描述一個實數隨機變數X的機率分布,是PDF的積分。
監督學習:基於已知類別的樣本調整分類器的參數,使其達到所要求效能的過程,如SVM,最大熵,CRF。
CRF(條件隨機場)與HMM(隱馬模型)和MEMM(最大熵隱馬模型)相比:
特徵靈活,可容納較多上下文資訊,全域最優,缺點是訓練代價大,複雜度高。
無監督學習:對沒有分類標記的訓練樣本進行學習,以發現訓練樣本集中的結構性知識的過程。
基於核的機器學習演算法:RBF(徑向基函數)、LDA、SVM。
特徵選取方法:卡方、資訊增益、平均互資訊、期望交叉熵。
特徵降維方法:PCA、LDA、深度學習sparseAutoEncodrer、矩陣奇異值分解SVD、LASSO、小波分析、拉普拉斯特徵映射。
LDA(Linear Discriminant Analysis 線性判別分析),是一種監督學習。將帶上標籤的資料(點),通過投影的方法,投影到維度更低的空間中,使得投影后的點,形成按類別區分,一簇一簇的情況,相同類別的點,將會在投影后的空間中更接近。是一種線性分類器。分類的目標是,類別內的點距離越近越好(集中),類別間的點越遠越好。
PCA(主成分分析):PCA是一種無監督學習。LDA通常來說是作為一個獨立的演算法存在,給定了訓練資料後,將會得到一系列的判別函數(discriminate function),之後對於新的輸入,就可以進行預測了。而PCA更像是一個預先處理的方法,目標是通過某種線性投影,將高維的資料對應到低維的空間中表示,並期望在所投影的維度上資料的方差最大,以此使用較少的資料維度,同時保留住較多的原資料點的特性。PCA追求的是在降維之後能夠最大化保持資料的內在資訊,並通過衡量在投影方向上的資料方差的大小來衡量該方向的重要性。但是這樣投影以後對資料的區分作用並不大,反而可能使得資料點揉雜在一起無法區分。這也是PCA存在的最大一個問題,這導致使用PCA在很多情況下的分類效果並不好。PCA的變換矩陣是共變數矩陣。
a*b和b*c兩矩陣相乘效率為a*b*c。
線性非線性問題:
偽逆法:是RBF神經網路的訓練演算法,徑向基解決的就是線性不可分情況。
HK演算法:在最小均方誤差準則下求得權向量,適用於線性可分和非線性可分的情況。對於線性可分的情況,給出最優權向量,
對於非線性可分的情況,能夠判別出來,以退出迭代過程。
勢函數法:非線性。
時間序列模型:
AR:線性預測;
MA:滑動平均模型,模型參量法譜分析方法之一;
ARMA:自迴歸滑動平均模型,模型參量法高解析度譜分析方法之一,比前兩者有較精確的譜估計及較優的譜解析度效能,但其參數估算比較繁瑣。
GARCH:廣義ARCH模型,特別適用于波動性的分析和預測。
判別式模型:羅吉斯迴歸、SVM、傳統神經網路、最近鄰、CRF、LDA、boosting、線性迴歸。
產生式模型:高斯、樸素貝葉斯、HMMS、sigmoid belief networks、MRF、Latent Dirichlet Allocation。
EM演算法: 只有觀測序列,無狀態序列時來學習模型參數;
維特比演算法: 用動態規劃解決HMM的預測問題,不是參數估計;
前向後向:算機率;
極大似然估計:即觀測序列和相應的狀態序列都存在時的監督學習演算法,用來估計參數。
EXCEL中MATCH函數可返回指定內容所在位置,INDEX又可根據位置查詢所對應資料。
MATCH(lookup-value,lookup-array,match-type)
INDEX(array,row-num,column-num)
聚類演算法
聚類演算法是機器學習的一個重要分支,是一種無監督學習,一般用於資料探索,比如群組發現和離群點檢測,還可以作為其他演算法的預先處理步驟。常見聚類演算法分類有K-Means, K-Medoids, GMM, Spectral clustering,Ncut等。
分類:
1. Partitioning approach:
建立資料的不同分割,然後用相同標準評價聚類結果。(比如最小化平方誤差和)目標:找出一個分割,使得距離平方和最小
典型演算法:K-Means, K-Medoids
K-Means演算法:
1. 選擇K個點作為初始質心(隨機產生或者從D中選取)
2. repeat
3. 將每個點分配到最近的質心,形成K個簇
4. 重新計算每個簇的質心
5. until 簇不發生變化或達到最大迭代次數
2. Model-based:
對於每個類假定一個分布模型,試圖找到每個類最好的模型
典型演算法:GMM(混合高斯)
GMM:將k個高斯模型混合在一起,每個點出現的機率是幾個高斯混合的結果。EM應用到GMM進行參數的求解。
3. Dimensionality Reduction Approach:
先降維,再聚類
典型演算法:Spectral clustering,Ncut
分類器
分類器是資料採礦中對樣本進行分類的方法的統稱,包含決策樹、羅吉斯迴歸、樸素貝葉斯、神經網路等演算法。
分類器的構造和實施步驟:
- 選定樣本(正負樣本),分成訓練樣本和測試樣本兩部分。
- 在訓練樣本上執行分類器演算法,產生分類模型。
- 在測試樣本上執行分類模型,產生預測結果。
- 根據預測結果,計算必要的評估指標,評估分類模型的效能。
(1)決策樹(Decision Tree):是在已知各種情況發生機率的基礎上,通過構成決策樹來求取淨現值的期望值大於等於零的機率,評價項目風險,判斷其可行性的決策分析方法,是直觀運用機率分析的一種圖解法,是一種監督學習。優點是可讀性好,反覆使用,每次預測的最大計算次數不超過決策樹的深度。
在機器學習中,隨機森林Random Forest是一個包含多個決策樹的分類器, 並且其輸出的類別是由個別樹輸出的類別的眾數而定。
隨機森林的構建有兩個方面:資料的隨機性選取,以及待選特徵的隨機選取。
1、資料的隨機性選取:首先,從原始的資料集中採取有放回的抽樣,構造子資料集,子資料集的資料量是和未經處理資料集相同的。不同子資料集的元素可以重複,同一個子資料集中的元素也可以重複。第二,利用子資料集來構建子決策樹,將這個資料放到每個子決策樹中,每個子決策樹輸出一個結果。最後,如果有了新的資料需要通過隨機森林得到分類結果,就可以通過對子決策樹的判斷結果的投票,得到隨機森林的輸出結果了。
2、待選特徵的隨機選取:與資料集的隨機選取類似,隨機森林中的子樹的每一個分裂過程並未用到所有的待選特徵,而是從所有的待選特徵中隨機選取一定的特徵,之後再在隨機選取的特徵中選取最優的特徵。這樣能夠使得隨機森林中的決策樹都能夠彼此不同,提升系統的多樣性,從而提升分類效能。
(2)羅吉斯迴歸:它不是一個迴歸模型,而是一個分類模型。
模型特點:
1. 優點:訓練快、易實現;
2. 缺點:欠擬合,對於複雜的任務效果不夠好;
計算方法很簡單,分為兩步:1,計算梯度,2,更新權值。
羅吉斯迴歸的目的是為了尋找非線性函數Sigmoid的最佳擬合參數中的權值w,其w的值通過梯度上升法來學習到。隨機梯度上升一次只處理少量的樣本,節約了計算資源,同時也使得演算法可以線上學習。
(3)貝葉斯分類:是一類分類演算法的總稱,這類演算法均以貝葉斯定理為基礎,故統稱為貝葉斯分類。
貝葉斯定理:
;
貝葉斯分類中最簡單的一種:樸素貝葉斯分類。其思想基礎是:對於給出的待分類項,求解在此項出現的條件下各個類別出現的機率,哪個最大,就認為此待分類項屬於哪個類別。
對於先驗機率p(y):
當p(y)已知,使用貝葉斯公式求後驗機率即可。
當p(y)未知,使用N-P決策來計算決策面。
最大最小損失規則主要就是解決最小損失規則時先驗機率未知或難以計算的問題。
線性分類器三大類:
感知器準則函數,SVM,Fisher準則
SVM:
支援向量機SVM(Support Vector Machine)是一個有監督的學習模型,通常用來進行模式識別、分類以及迴歸分析。
主要思想可以概括為兩點:
⑴它是針對線性可分情況進行分析,對於線性不可分的情況,通過使用非線性映射演算法將低維輸入空間線性不可分的樣本轉化為高維特徵空間使其線性可分,從而使得高維特徵空間採用線性演算法對樣本的非線性特徵進行線性分析成為可能;
⑵它基於結構風險最小化理論之上在特徵空間中建構最優分割超平面,使得學習器得到全域最佳化,並且在整個樣本空間的期望風險以某個機率滿足一定上界。
一般特徵⑴SVM學習問題可以表示為凸最佳化問題,因此可以利用已知的有效演算法發現目標函數的全域最小值。而其他分類方法(如基於規則的分類器和人工神經網路)都採用一種基於貪心學習的策略來搜尋假設空間,這種方法一般只能獲得局部最優解。⑵SVM通過最大化決策邊界的邊緣來控制模型的能力。儘管如此,使用者必須提供其他參數,如使用核函數類型和引入鬆弛變數等。SVM的核函數包括:線性、多項式、徑向基、高斯、冪指數、拉普拉斯、ANOVA、二次有理、多元二次、逆多元二次以及sigmoid核函數。⑶通過對資料中每個分類屬性引入一個啞變數,SVM可以應用於分類資料。⑷SVM一般只能用在二類問題,對於多類問題效果不好。
機器學習演算法