資料採礦簡介

來源:互聯網
上載者:User
        資料採礦是從大量的、不完全的、有雜訊的、模糊的、隨機的資料集中識別有效、新穎的、潛在有用的,以及最終可理解的模式的非平凡過程。它是一門涉及面很廣的交叉學科,包括 機器學習數理統計神經網路資料庫模式識別粗糙集模糊數學等相關技術。

 

       由於資料採礦是一門受到來自各種不同領域的研究者關注的交叉性學科,因此導致了很多不同的術語名稱。其中,最常用的術語是"知識發現"和"資料採礦"。相對來講,資料採礦主要流行於統計界(最早出現於統計文獻中)、資料分析、資料庫和管理資訊系統界;而知識發現則主要流行於人工智慧和機器學習界。

      資料採礦可粗略地理解為三部曲:資料準備(data preparation)、資料採礦,以及結果的解釋評估(interpretation and evaluation)。 

      根據資料採礦的任務分,有如下幾種:分類或預測模型資料採礦、資料總結、資料聚類、關聯規則發現、序列模式發現、依賴關係或依賴模型發現、異常和趨勢發現等等。

      根據資料採礦的對象分,有如下若干種資料來源:關聯式資料庫、物件導向資料庫、空間資料庫、時態資料庫、文本資料來源、多媒體資料、異質資料庫、遺產(legacy)資料庫,以及Web資料來源

      根據資料採礦的方法分,可粗分為:統計方法、機器學習方法、神經網路方法和資料庫方法。統計方法中,可細分為:迴歸分析(多元迴歸、自迴歸等)、判別分析(貝葉斯判別、費歇爾判別、非參數判別等)、群集(系統聚類、動態聚類等)、探索性分析(主元分析法、相關分析法等)、以及模糊集、粗糙集、支援向量機等。機器學習中,可細分為:歸納學習方法(決策樹、規則歸納等)、基於範例的推理CBR、遺傳演算法、貝葉斯信念網路等。神經網路方法,可細分為:前向神經網路(BP演算法等)、自組織神經網路(自組織特徵映射、競爭學習等)等。資料庫方法主要是基於可視化的多維資料分析或OLAP方法,另外還有面向屬性的歸納方法。 

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.