梳理:
A Convolutional Neural Network Cascade for Face Detection是CNN與級聯思想在檢測的應用
From Facial Parts Responses to Face Detection A Deep Learning Approach是關鍵點檢測與CNN結合的思想
Object Detection with Pixel Intensity Comparisons Organized in Decision Trees 是決策樹思想
Joint Cascade Face Detection and Alignment 是用決策樹實現檢測與矯正結合的思想
Face Alignment at 3000 FPS via Regressing Local Binary Features 是上文的關鍵點檢測演算法
實現思路:
研究主要集中於以下三點內容:
第一部分是關於特徵的設計與選擇,有效特徵能夠表達映像中所蘊藏的資訊,同時又足夠簡單,有助於減少計算量。
第二部分是關於臉部偵測與矯正的結合方法,臉部偵測與矯正,一個是二分類問題,一個是迴歸問題,將二者結合在一起的目的不僅僅是為了節省時間效率,更是為了利用矯正的結果提高臉部偵測的準確率與速度。
第三部分是關於決策樹與卷積神經網路級連接構的設計,該卷積神經網路需要與決策樹相契合,一種做法是在級聯的前端選擇決策樹,後端選擇卷積神經網路,這樣可以在前端過濾掉大多數負例,在後端利用CNN來保證較高的正確率。
各個部分的關鍵問題主要集中於以下幾點:
1、關於特徵的選擇,由於人類檢測與矯正需要在同一步完成,那麼就需要這種特徵既能用於臉部偵測,又能用於人臉矯正,這需要它具有廣泛的適用性。
2、臉部偵測與矯正的結合方式無論是決策樹還是卷積神經網路,雖然都已有實現的先例,但由於我們的架構採用了決策樹與神經網路混合的結構,那麼就不能只是生硬的銜接二者,否則會使整個架構過於複雜,需要重新設計二者演算法,使其流暢的貫穿於整個過程。
3、目前決策樹與卷積神經網路的結合并沒有被廣泛認可的實現,實現一種真正能一加一大於二的聯合方式將是本文的重點與痛點。
初步技術思路:
針對第一部分,特徵的選擇上應以簡單與有效為首要,針對隨機像素點或是以LBP提取像素域的隨機對比有著出色的表現效果,可以延用或是設計一種新的特徵表達方法。
針對第二部分,臉部偵測與矯正的結合,在決策樹方面,近年來已有其分類樹與迴歸樹的加權結合方法[8],而在卷積神經網路方面,也提出一種以關鍵點為特徵的檢測人臉的神經網路結構[7],Yang S等人提出的DCN網路結構雖然能在一輪卷積計算中計算出所有的特徵map,但是在大多數實際應用中,圖片中的人臉數量主要為一個且位於中心,如果能夠利用決策樹在前期提供一些候選人臉地區,然後再用DCN分別卷積計算這些小的人臉地區,雖然卷積輪數變多了,但是由於輸入圖片變小,計算量是指數級下降的。
針對第三部分,決策樹與卷積神經網路的結合,目前決策樹的級聯架構較為常見,卷積神經網路的級連接構也已有實現,可以將二者去頭掐尾的結合到一起,但是也可以設計出一種更簡潔有效拓撲結構將二者級聯到一起。