支援中文文本的資料採礦平台開源項目PyMining發布

前言     最近一個月,過年的時候天天在家裡獃著,年後公司的事情也不斷,有一段時間沒有更新部落格了。PyMining是我最近一段時間構思的一個項目,雖然目前看來比較微型。該項目主要是針對中文文本的資料採礦演算法的實驗與應用。從項目的目標來說,希望使用者可以很方便的使用現有的資料採礦、機器學習演算法與添加需要的演算法。 項目概述    

PyMining-開源中文文本資料採礦平台 Ver 0.2發布

項目首頁:http://code.google.com/p/python-data-mining-platform/ (可能需翻牆)目前比如tutorial, install,

貝葉斯、機率分布與機器學習

本文由LeftNotEasy原創,可以轉載,但請保留出處和此行,如果有商業用途,請聯絡作者 wheeleast@gmail.com 一.

hadoop雜記-為什麼會有Map-reduce v2 (Yarn)

前言:有一段時間沒有寫部落格了(發現這是我部落格最常見的開頭,不過這次間隔真的好長),前段時間事情比較多,所以耽擱得也很多。現在準備計劃寫一個新的專題,叫做《hadoop雜記》,裡面的文章有深有淺,文章不是按入門-中級-進階的順序組織的,如果想看看從入門到深入的書,比較推薦《the definitive guide of hadoop》。今天主要想寫寫關於map-reduce v2(或者叫map-reduce next

支援向量機(三)核函數

7 核函數(Kernels) 考慮我們最初在“線性迴歸”中提出的問題,特徵是房子的面積x,這裡的x是實數,結果y是房子的價格。假設我們從樣本點的分布中看到x和y符合3次曲線,那麼我們希望使用x的三次多項式來逼近這些樣本點。那麼首先需要將特徵x擴充到三維,然後尋找特徵和結果之間的模型。我們將這種特徵變換稱作特徵映射(feature mapping)。映射函數稱作,在這個例子中 我們希望將得到的特徵映射後的特徵應用於SVM分類,而不是最初的特徵。這樣,我們需要將前面公式中的內積從,映射到。

機器學習中的演算法(2)-支援向量機(SVM)基礎

著作權聲明:    本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com 前言:    又有很長的一段時間沒有更新部落格了,距離上次更新已經有兩個月的時間了。其中一個很大的原因是,不知道寫什麼好-_-,最近一段時間看了看關於SVM(Support Vector

支援向量機(四)

9 規則化和不可分情況處理(Regularization and the non-separable case) 我們之前討論的情況都是建立在範例線性可分的假設上,當範例線性不可分時,我們可以嘗試使用核函數來將特徵映射到高維,這樣很可能就可分了。然而,映射後我們也不能100%保證可分。那怎麼辦呢,我們需要將模型進行調整,以保證在不可分的情況下,也能夠儘可能地找出分隔超平面。 看下面兩張圖: 可以看到一個離群點(可能是雜訊)可以造成超平面的移動,間隔縮小,可見以前的模型對雜訊非常敏感。再有甚者,

機器學習中的演算法(1)-決策樹模型組合之隨機森林與GBDT

著作權聲明:    本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com前言:   

機器學習中的數學(4)-線性判別分析(LDA), 主成分分析(PCA)

著作權聲明:    本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com前言:   

K-means聚類演算法

     K-means也是聚類演算法中最簡單的一種了,但是裡麵包含的思想卻是不一般。最早我使用並實現這個演算法是在學習韓爺爺那本資料採礦的書中,那本書比較注重應用。看了Andrew Ng的這個講義後才有些明白K-means後麵包含的EM思想。    

機器學習中的數學(3)-模型組合(Model Combining)之Boosting與Gradient Boosting

著作權聲明:    本文由LeftNotEasy發佈於http://leftnoteasy.cnblogs.com, 本文可以被全部的轉載或者部分使用,但請註明出處,如果有問題,請聯絡wheeleast@gmail.com 前言:    本來上一章的結尾提到,準備寫寫線性分類的問題,文章都已經寫得差不多了,但是突然聽說最近Team準備做一套分布式的分類器,可能會使用Random Forest來做,下了幾篇論文看了看,簡單的random

混合高斯模型(Mixtures of Gaussians)和EM演算法

      這篇討論使用期望最大化演算法(Expectation-Maximization)來進行密度估計(density estimation)。      與k-means一樣,給定的訓練樣本是,我們將隱含類別標籤用表示。與k-means的硬指定不同,我們首先認為是滿足一定的機率分布的,這裡我們認為滿足多項式分布,,其中,有k個值{1,…,k}可以選取。而且我們認為在給定後,滿足多值高斯分布,即。由此可以得到聯合分布。     

機器學習中的數學(2)-線性迴歸,偏差、方差權衡

著作權聲明:    本文由LeftNotEasy所有,發佈於http://leftnoteasy.cnblogs.com。如果轉載,請註明出處,在未經作者同意下將本文用於商業用途,將追究其法律責任。如果有問題,請聯絡作者 wheeleast@gmail.com前言:   

線上學習(Online Learning)

      原題目叫做The perception and large margin classifiers,其實探討的是線上學習。這裡將題目換了換。以前討論的都是批量學習(batch learning),就是給了一堆範例後,在範例上學習出假設函數h。而線上學習就是要根據新來的範例,邊學習,邊給出結果。     

推薦本部落格博文

在我的部落格中,推薦以下專題機器學習中的數學系列:1) 迴歸(regression)、梯度下降(gradient descent)2) 線性迴歸,偏差、方差權衡3) 模型組合(Model Combining)之Boosting與Gradient Boosting4) 線性判別分析(LDA), 主成分分析(PCA)5) 強大的矩陣奇異值分解(SVD)及其應用 機器學習中的演算法系列:1) 決策樹 - 隨機森林與GBDT 2) SVM基礎 Hadoop科普系列:1)

主成分分析(Principal components analysis)-最大方差解釋

     在這一篇之前的內容是《Factor Analysis》,由於非常理論,打算學完整個課程後再寫。在寫這篇之前,我閱讀了PCA、SVD和LDA。這幾個模型相近,卻都有自己的特點。本篇打算先介紹PCA,至於他們之間的關係,只能是邊學邊體會了。PCA以前也叫做Principal factor analysis。1. 問題     真實的訓練資料總是存在各種各樣的問題:1、

判別模型、產生模型與樸素貝葉斯方法

轉載時請註明來源:http://www.cnblogs.com/jerrylead1判別模型與產生模型上篇報告中提到的迴歸模型是判別模型,也就是根據特徵值來求結果的機率。形式化表示為,在參數確定的情況下,求解條件機率。通俗的解釋為在給定特徵後預測結果出現的機率。

主成分分析(Principal components analysis)-最小平方誤差解釋

 接上篇3.2 最小平方誤差理論         

小談導數、梯度和極值

[轉載請註明出處] http://www.cnblogs.com/jerrylead 記得在高中做數學題時,經常要求曲線的切線。見到形如之類的函數,不管三七二十一直接求導得到,這就是切線的斜率,然後就得到了處的切線。 上大學又學習了曲面切線和法向量的求法,求偏導是法向量,然後套公式求出切線。 一個經典例子如下: (來自web上某個《幾何應用》ppt) 其中的向量n是F(x,y,z)的偏導數。 然而,這兩者求法看似無關啊,中求得的是切線,然而下面的求偏導後卻是法向量,為啥都是求導,差別這麼大呢?

支援向量機SVM(二)

【轉載請註明出處】http://www.cnblogs.com/jerrylead6 拉格朗日對偶(Lagrange duality)     先拋開上面的二次規劃問題,先來看看存在等式約束的極值問題求法,比如下面的最佳化問題:              目標函數是f(w),下面是等式約束。通常解法是引入拉格朗日運算元,這裡使用來表示運算元,得到拉格朗日公式為              L是等式約束的個數。    

總頁數: 61357 1 .... 6631 6632 6633 6634 6635 .... 61357 Go to: 前往

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.