深度學習開源圖片資料庫匯總_資料庫

來源:互聯網
上載者:User

資料的準備工作是訓練模型前的必要工作,顯然這也是非常耗時的,所以在入門階段我們完全可以用現有的開源圖片庫快速完成前期的準備工作: ImageNet

  ImageNet是根據WordNet階層(目前只有名詞)組織的映像資料庫,其中階層的每個節點都由數百和數千個映像描繪。 目前,資料庫中每個節點平均擁有超過五百幅映像。 我們希望ImageNet將成為研究人員,教育工作者,學生以及分享我們對圖片熱情的所有人的有用資源。
  ImageNet的一些特點:
  ImageNet是全球最大的開源圖片庫,截至到現在(2017.5)ImageNet共有一千四百多萬張圖片。其中包括超過20000個synset(s),synset是近義詞的合集,synsnet可以理解為ImageNet整理的標籤。
  說到WordNet階層,就要提一下什麼是WordNet,WordNet是普林斯頓大學開源的詞彙庫,可以理解為是一個詞典。每個詞語(word)可能有多個不同的語義,對應不同的sense。而每個不同的語義(sense)又可能對應多個詞,如topic和subject在某些情況下是同義的,WordNet由Princeton 大學的心理學家,語言學家和電腦工程師聯合設計的一種基於認知語言學的英語詞典。它不是光把單詞以字母順序排列,而且按照單詞的意義組成一個“單詞的網路”。WordNet 主要有3個主概念 Synset, WordSense 和 Word。而ImageNet就是應用了synset這個概念,只是ImageNet目前只有名詞。
  由於圖片的著作權問題,ImageNet中的圖片以URLs的形式提供下載,也就是說ImageNet只提供這個圖片在哪,而不直接提供圖片本身。

  我們在ImageNet搜尋一個synset的時,左側可以看到他的階層WordNet,在Download中提供了URLs的下載地址。 CIFAR

  CIFAR由Alex Krizhevsky, Vinod Nair和 Geoffrey Hinton收集並整理,在Visual Dictionary的80萬張圖片中選擇了6萬張,並把它們分為CIFAR-10 和CIFAR-100。
  CIFAR-10資料集包含60000個32*32的彩色映像,共有10類。有50000個訓練映像和10000個測試映像。資料集分為5個訓練塊和1個測試塊,每個塊有10000個映像。測試塊包含從每類隨機播放的1000個映像。訓練塊以隨機的順序包含這些映像,但一些訓練塊可能比其它類包含更多的映像。訓練塊每類包含5000個映像。
  CIFAR-100資料集包含100小類,每小類包含600個映像,其中有500個訓練映像和100個測試映像。100類被分組為20個大類。
MNIST

  MNIST深度學習領域中大名鼎鼎的資料集—MNIST,幾乎所有的深度學習教程的入門執行個體都是手寫數字識別,而它們用到的庫就是MNIST。這就好比我們學習一門語言的時候顯示”hello world”。
  MNIST資料集共包含7萬個樣本,分別是手寫體數字0~9,樣本大小為28*28。

Labeled Faces in the Wild

  Labeled Faces in the Wild資料庫中收集了1萬3千多張人臉映像,共包含了5000多個人物。每個人標記除了人物的名字外,還包含了其他資訊,比如性別,年齡等

Quick Draw

  Quick Draw是由google發布的塗鴉資料集,其中包含 5000 萬張圖畫的集合,分成了 345 個類別,它其實就是張這個樣子:

  這麼看起來這個資料集還是挺無聊的,它的發布其實是源於Google推出的 AutoDraw ,這是一個能把你的隨手塗鴉變成繪畫的人工智慧技術工具,就是這樣(Google總是在做一些很好玩的東西):

  Google也曾發布論文和部落格介紹了其背後的技術。實際上,AutoDraw 所用的技術基於Google先前的塗鴉實驗「Quick, Draw!」。近日,Google發布了該項目背後的資料集,就是之前提到的Quick Draw資料集了。這個項目同時發布到了git上,在git的地址中對資料集進行了詳細的介紹,在這裡簡要描述下:

  未經處理資料在 ndjson 檔案中,並按類別進行了分割,按照如下格式:

  該資料集在Google雲端儲存體服務中,在 ndjson 檔案中分類儲存。請參閱 Cloud Console 中的檔案清單,資料集分類如下:

Raw files (.ndjson)
Simplified drawings files (.ndjson)
Binary files (.bin)
Numpy bitmap files (.npy)

  其中原始檔案和簡筆畫都是.ndjson形式儲存,同時提供了二進位檔案(.bin)和Numpy 位元影像(.npy)檔案。

Binary files (.bin)
  我們也提供了簡化後的繪畫和中繼資料的定製二進位格式,可用於高效的壓縮和載入。examples/binary_file_parser.py 給出了如何用 Python 載入該檔案的樣本。

Numpy 位元影像(.npy)
  所有簡化過的繪畫也都被轉換成了 28×28 的灰階位元影像,儲存為 numpy 的 .npy 格式。該檔案可以通過 np.load() 函數載入。 AI-Challneger

  AI-Challneger是一個由創新工場發起的大賽,其中有6個項目,每一個項目下都提供了配套的資料集,比如情境分類項目下,到目前為止提供了三個資料集,分別是訓練集(train),驗證集(valuation)和測試集A(test_a),分別包含圖片5w+,7k+,7k+;包含80類情境圖,支援直接下載原圖。
kaggle cats vs. dogs

  貓狗大戰資料集,大名鼎鼎的kaggle大賽下的資料,一個二分類資料集,訓練集中貓狗圖片各12500張,測試集中貓狗圖片共12500張,支援原圖下載。
notMNIST

  notMNIST資料集起做這個名字是為了致敬MNIST,它提供了從A到J是個字母的圖片,圖片大小為28*28,而且圖片不是手寫字母,而是來源於網路上各種各樣奇奇怪怪的圖片,比如字母A:

  該資料集提供了兩個版本,其中large版中,每個類大概5.3W左右的圖片,總數在53W個,類別間資料比較平均。 Pascal VOC

  PASCAL VOC挑戰賽是視覺物件的分類識別和檢測的一個基準測試,提供了檢測演算法和學習效能的標準映像注釋資料集和標準的評估系統。PASCAL VOC圖片集包括20個目錄:人類;動物(鳥、貓、牛、狗、馬、羊);交通工具(飛機、單車、船、公用汽車、小轎車、>機車、火車);室內(瓶子、椅子、餐桌、盆栽植物、沙發、電視)。PASCAL VOC挑戰賽在2012年後便不再舉辦,但其資料集映像品質好,標註完備,非常適合用來測試演算法效能。

COCO common objects Dataset

  COCO資料集由微軟贊助,其對於映像的標註資訊不僅有類別、位置資訊,還有對映像的語義文本描述,COCO資料集的開源使得近兩三年來映像分割語義理解取得了巨大的進展,也幾乎成為了映像語義理解演算法效能評價的“標準”資料集。Google的開源show and tell產生模型就是在此資料集上測試的。
目前包含的比賽項目有:
1.目標檢測(COCO Detection Challenge),包含兩項比賽:
  輸出目標物的邊框即可(using bounding box output),也就是我們常說的目標檢測(object detection)了
要求把目標物從映像中分割出來(object segmentation output),即我們所說的映像語義分割(Semantic image segmentation)
2.映像標註(COCO Captioning Challenge)
  具體說來就是一句話準確描述圖片上的資訊(producing image captions that are informative and accurate)。那這個怎麼評分呢。目前是靠人工評分。
3.人體關鍵點檢測(COCO Keypoint Challenge)
  比賽要求是找到人在哪,然後定位到人體的一些關鍵點位置(The keypoint challenge involves simultaneously detecting people and localizing their keypoints)。
CityScapes

  CityScapes資料情境包括50個不同城市(主要在德國),春夏秋三個季節白天的情境,有大量的動態目標不同層次的情境和多樣的背景。情境不包括下大雨的和下雪的,因為這種情境需要用特殊的技術處理。
  映像資料分為30類:除了有 5000幀細標註的(像素層級的),標註一張圖時間控制在1.5h左右,精細標註的資料劃分成如下圖訓練驗證測試集,不是隨機劃分的,而是確保每個劃分的資料集裡麵包含各種情境。最終有2975張用來訓練,500張用來驗證,1525張用來測試。此外,還有20000張弱標註的幀,只用來訓練,標註一張圖控制在7min內。

持續更新中……

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.