Time of Update: 2018-12-07
前言 最近一個月,過年的時候天天在家裡獃著,年後公司的事情也不斷,有一段時間沒有更新部落格了。PyMining是我最近一段時間構思的一個項目,雖然目前看來比較微型。該項目主要是針對中文文本的資料採礦演算法的實驗與應用。從項目的目標來說,希望使用者可以很方便的使用現有的資料採礦、機器學習演算法與添加需要的演算法。 項目概述
Time of Update: 2018-12-07
項目首頁:http://code.google.com/p/python-data-mining-platform/ (可能需翻牆)目前比如tutorial, install,
Time of Update: 2018-12-07
本文由LeftNotEasy原創,可以轉載,但請保留出處和此行,如果有商業用途,請聯絡作者 wheeleast@gmail.com 一.
Time of Update: 2018-12-07
前言:有一段時間沒有寫部落格了(發現這是我部落格最常見的開頭,不過這次間隔真的好長),前段時間事情比較多,所以耽擱得也很多。現在準備計劃寫一個新的專題,叫做《hadoop雜記》,裡面的文章有深有淺,文章不是按入門-中級-進階的順序組織的,如果想看看從入門到深入的書,比較推薦《the definitive guide of hadoop》。今天主要想寫寫關於map-reduce v2(或者叫map-reduce next
Time of Update: 2018-12-07
7 核函數(Kernels) 考慮我們最初在“線性迴歸”中提出的問題,特徵是房子的面積x,這裡的x是實數,結果y是房子的價格。假設我們從樣本點的分布中看到x和y符合3次曲線,那麼我們希望使用x的三次多項式來逼近這些樣本點。那麼首先需要將特徵x擴充到三維,然後尋找特徵和結果之間的模型。我們將這種特徵變換稱作特徵映射(feature mapping)。映射函數稱作,在這個例子中 我們希望將得到的特徵映射後的特徵應用於SVM分類,而不是最初的特徵。這樣,我們需要將前面公式中的內積從,映射到。
Time of Update: 2018-12-07
著作權聲明: 本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com 前言: 又有很長的一段時間沒有更新部落格了,距離上次更新已經有兩個月的時間了。其中一個很大的原因是,不知道寫什麼好-_-,最近一段時間看了看關於SVM(Support Vector
Time of Update: 2018-12-07
9 規則化和不可分情況處理(Regularization and the non-separable case) 我們之前討論的情況都是建立在範例線性可分的假設上,當範例線性不可分時,我們可以嘗試使用核函數來將特徵映射到高維,這樣很可能就可分了。然而,映射後我們也不能100%保證可分。那怎麼辦呢,我們需要將模型進行調整,以保證在不可分的情況下,也能夠儘可能地找出分隔超平面。 看下面兩張圖: 可以看到一個離群點(可能是雜訊)可以造成超平面的移動,間隔縮小,可見以前的模型對雜訊非常敏感。再有甚者,
Time of Update: 2018-12-07
著作權聲明: 本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com前言:
Time of Update: 2018-12-07
著作權聲明: 本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com前言:
Time of Update: 2018-12-07
K-means也是聚類演算法中最簡單的一種了,但是裡麵包含的思想卻是不一般。最早我使用並實現這個演算法是在學習韓爺爺那本資料採礦的書中,那本書比較注重應用。看了Andrew Ng的這個講義後才有些明白K-means後麵包含的EM思想。
Time of Update: 2018-12-07
著作權聲明: 本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com 前言: 本來上一章的結尾提到,準備寫寫線性分類的問題,文章都已經寫得差不多了,但是突然聽說最近Team準備做一套分布式的分類器,可能會使用Random Forest來做,下了幾篇論文看了看,簡單的random
Time of Update: 2018-12-07
這篇討論使用期望最大化演算法(Expectation-Maximization)來進行密度估計(density estimation)。 與k-means一樣,給定的訓練樣本是,我們將隱含類別標籤用表示。與k-means的硬指定不同,我們首先認為是滿足一定的機率分布的,這裡我們認為滿足多項式分布,,其中,有k個值{1,…,k}可以選取。而且我們認為在給定後,滿足多值高斯分布,即。由此可以得到聯合分布。
Time of Update: 2018-12-07
著作權聲明: 本文由LeftNotEasy所有,發佈於http://leftnoteasy.cnblogs.com。如果轉載,請註明出處,在未經作者同意下將本文用於商業用途,將追究其法律責任。如果有問題,請聯絡作者 wheeleast@gmail.com前言:
Time of Update: 2018-12-07
原題目叫做The perception and large margin classifiers,其實探討的是線上學習。這裡將題目換了換。以前討論的都是批量學習(batch learning),就是給了一堆範例後,在範例上學習出假設函數h。而線上學習就是要根據新來的範例,邊學習,邊給出結果。
Time of Update: 2018-12-07
在我的部落格中,推薦以下專題機器學習中的數學系列:1) 迴歸(regression)、梯度下降(gradient descent)2) 線性迴歸,偏差、方差權衡3) 模型組合(Model Combining)之Boosting與Gradient Boosting4) 線性判別分析(LDA), 主成分分析(PCA)5) 強大的矩陣奇異值分解(SVD)及其應用 機器學習中的演算法系列:1) 決策樹 - 隨機森林與GBDT 2) SVM基礎 Hadoop科普系列:1)
Time of Update: 2018-12-07
在這一篇之前的內容是《Factor Analysis》,由於非常理論,打算學完整個課程後再寫。在寫這篇之前,我閱讀了PCA、SVD和LDA。這幾個模型相近,卻都有自己的特點。本篇打算先介紹PCA,至於他們之間的關係,只能是邊學邊體會了。PCA以前也叫做Principal factor analysis。1. 問題 真實的訓練資料總是存在各種各樣的問題:1、
Time of Update: 2018-12-07
轉載時請註明來源:http://www.cnblogs.com/jerrylead1判別模型與產生模型上篇報告中提到的迴歸模型是判別模型,也就是根據特徵值來求結果的機率。形式化表示為,在參數確定的情況下,求解條件機率。通俗的解釋為在給定特徵後預測結果出現的機率。
Time of Update: 2018-12-07
接上篇3.2 最小平方誤差理論
Time of Update: 2018-12-07
[轉載請註明出處] http://www.cnblogs.com/jerrylead 記得在高中做數學題時,經常要求曲線的切線。見到形如之類的函數,不管三七二十一直接求導得到,這就是切線的斜率,然後就得到了處的切線。 上大學又學習了曲面切線和法向量的求法,求偏導是法向量,然後套公式求出切線。 一個經典例子如下: (來自web上某個《幾何應用》ppt) 其中的向量n是F(x,y,z)的偏導數。 然而,這兩者求法看似無關啊,中求得的是切線,然而下面的求偏導後卻是法向量,為啥都是求導,差別這麼大呢?
Time of Update: 2018-12-07
【轉載請註明出處】http://www.cnblogs.com/jerrylead6 拉格朗日對偶(Lagrange duality) 先拋開上面的二次規劃問題,先來看看存在等式約束的極值問題求法,比如下面的最佳化問題: 目標函數是f(w),下面是等式約束。通常解法是引入拉格朗日運算元,這裡使用來表示運算元,得到拉格朗日公式為 L是等式約束的個數。