Hive基礎之Hive是什麼以及使用情境

來源:互聯網
上載者:User

標籤:style   http   color   java   使用   io   strong   檔案   

Hive是什麼
1)Hive 是建立在Hadoop (HDFS/MR)上的用於管理和查詢結果化/非結構化的資料倉儲;
2)一種可以儲存、查詢和分析儲存在Hadoop 中的大規模資料的機制;
3)Hive 定義了簡單的類SQL 查詢語言,稱為HQL,它允許熟悉SQL 的使用者查詢資料;
4)允許用Java開發自訂的函數UDF來處理內建無法完成的複雜的分析工作;
5)Hive沒有專門的資料格式(分隔字元等可以自己靈活的設定);

 

ETL的流程(Extraction-Transformate-Loading):將關係型資料庫的資料幫浦到HDFS上,hive作為資料倉儲,經過hive的計算分析後,將結果再匯入到關係型資料庫的過程。


官方學習嚮導:https://cwiki.apache.org/confluence/display/Hive/Tutorial

Hive是構建在Hadoop之上的資料倉儲
1)使用HQL作為查詢介面;
2)使用HDFS作為儲存;
3)使用MapReduce作為計算;

 

Hive應用情境
資料來源:
1)檔案資料,如中國移動某裝置每天產生大量固定格式的檔案;
2)資料庫

以上兩種不同的資料來源有個共同點:要使用hive,那麼必須要將資料放到hive中;通常採用如下兩種方式:
1)檔案資料:load到hive
2)資料庫: sqoop到hive

資料的離線處理;
hive的執行延遲比較高,因為hive常用於資料分析的,對即時性要求不高;
hive優勢在於處理大資料,對於處理小資料沒有優勢,因為hive的執行延遲比較高。

處理資料存放在hive表中,那麼前台系統怎麼去訪問hive的資料呢?
先將hive的處理結果資料轉移到關係型資料庫中才可以,sqoop就是執行匯入匯出的操作

 

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.