寫一個簡單的專題吧:Object Recognition and Scene Understanding,包括以下三大塊內容:
1.Object Recognition from Local Scale-Invariant Features,基於特徵的目標識別演算法,最具代表性的就是David G. Lowe的SIFT特徵。
該部分內容作者已經申請專利,這裡就不多做介紹
2. Histograms of Oriented Gradients for Human Detection
基於HOG特徵的行人檢測
3. A Discriminatively Trained, Multiscale, Deformable Part Model
DPM 目前為止比較好的目標檢測演算法
按照以上架構,盡量利用網路資源,這樣可以集合大家的力量,分享這部分內容。
HOG特徵
http://blog.csdn.net/carson2005/article/details/7782726
梯度長條圖特徵(HOG) 是一種對映像局部重疊地區的密集型描述符,它通過計算局部地區的梯度方向長條圖來構成特徵。Hog特徵結合SVM分類器已經被廣泛應用於Image Recognition中,尤其在行人檢測中獲得了極大的成功。需要提醒的是,HOG+SVM進行行人檢測的方法是法國研究人員Dalal在2005的CVPR上提出的,而如今雖然有很多行人檢測演算法不斷提出,但基本都是以HOG+SVM的思路為主。
HOG特徵是一種局部地區描述符,它通過計算局部地區上的梯度方向長條圖來構成人體特徵,能夠很好地描述人體的邊緣。它對光照變化和小量的位移不敏感。
映像中像素點(x,y)的梯度為
Dalal提出的Hog特徵提取的過程:把樣本映像分割為若干個像素的單元(cell),把梯度方向平均劃分為9個區間(bin),在每個單元裡面對所有像素的梯度方向在各個方向區間進行長條圖統計,得到一個9維的特徵向量,每相鄰的4個單元構成一個塊(block),把一個塊內的特徵向量聯起來得到36維的特徵向量,用塊對樣本映像進行掃描,掃描步長為一個單元。最後將所有塊的特徵串聯起來,就得到了人體的特徵。例如,對於64*128的映像而言,每2*2的單元(16*16的像素)構成一個塊,每個塊內有4*9=36個特徵,以8個像素為步長,那麼,水平方向將有7個掃描視窗,垂直方向將有15個掃描視窗。也就是說,64*128的圖片,總共有36*7*15=3780個特徵。
在行人檢測過程中,除了上面提到的HOG特徵提取過程,還包括彩圖轉灰階,亮度校正等步驟。總結一下,在行人檢測中,HOG特徵計算的步驟:
(1)將輸入的彩圖轉換為灰階圖;
(2)採用Gamma校正法對輸入映像進行色彩空間的標準化(歸一化); 目的是調節映像的對比,降低映像局部的陰影和光照變化所造成的影響,同時可以抑制噪音的幹擾;
(3)計算梯度;主要是為了捕獲輪廓資訊,同時進一步弱化光照的幹擾。
(4)將梯度投影到單元的梯度方向;目的是為局部映像地區提供一個編碼,
(5)將所有儲存格在塊上進行歸一化;歸一化能夠更進一步對光照、陰影和邊緣進行壓縮,通常,每個儲存格由多個不同的塊共用,但它的歸一化是基於不同塊的,所以計算結果也不一樣。因此,一個儲存格的特徵會以不同的結果多次出現在最後的向量中。我們將歸一化之後的塊描述符就稱之為HOG描述符。
(6)收集得到檢測空間所有塊的HOG特徵;該步驟就是將檢測視窗中所有重疊的塊進行HOG特徵的收集,並將它們結合成最終的特徵向量供分類使用。