Time of Update: 2018-08-20
<configuration> <property> <name>dfs.replication</name> <value>3</value>
Time of Update: 2018-08-20
/hadoop/etc/hadoop/ Eclipse :: http://my.oschina.net/lanzp/blog/309078?fromerr=blt5oYkF core-site.xml <?xml version="1.0" encoding="UTF-8"?> <?xml-stylesheet type="text/xsl&
Time of Update: 2018-08-20
2016-05-29 23:00:09,532 WARN [Thread-12] mapred.LocalJobRunner (LocalJobRunner.java:run(560)) - job_local1841304029_0001 java.lang.Exception: java.lang.NullPointerException at
Time of Update: 2018-08-20
package com.xing.streamimport kafka.serializer.StringDecoderimport org.apache.spark.SparkConfimport org.apache.spark.streaming.kafka.KafkaUtilsimport org.apache.spark.streaming.{Seconds, StreamingContext}/** * Created by DengNi on 2016/12/16.
Time of Update: 2018-08-20
今天在bluemix 上簡易的搭建了一個hadoop cluster , 憨的是 hadoop 命令忘的查不到了,今天補充溫故知新 FS Shell 調用檔案系統(FS)Shell命令應使用 bin/hadoop fs <args>的形式。 所有的的FS
Time of Update: 2018-08-20
大資料架構簡單流程圖 nginx ---->flume ----->kafka ----> storm -----> hdfs(mysql)------>hbse(hive)---->spark(MR) 航空電商大規模即時日誌分析 flume ----->kafka ----> storm -----> hdfs"> 1).資料擷取 負責從各節點上即時採集資料,
Time of Update: 2018-08-20
Hive實現從表中隨機抽樣得到一個不重複的資料樣本 方法一: select * from table_a order by rand() limit 100; 方法二: select * from ( select e.*, cast(rand() * 100000 as int) as vidx from e ) vt order by vt.vidx limit 1000
Time of Update: 2018-08-20
Unexpected Error occurred attempting to open an SQL connection. java.util.concurrent.TimeoutException at java.util.concurrent.FutureTask.get(Unknown Source) at
Time of Update: 2018-08-20
最近在看《Neural Network Design_Hagan》 然後想自己實現一個XOR 的網路。 由於單層神經網路不能將異或的判定分為兩類。 根據 a^b=(a&~b)|(~a&b) 而 我試了一下 或 和 與 都可以用感知神經元解決,也就是一個。 那麼與和或的實現: hardlim (n )=a ,n>=0時 a=1;n<0時a=0; 顯然需要三個神經元 神經元運算式如下:
Time of Update: 2018-08-20
在IBM datastage job 中我們知道共有三種類型,在此簡單闡述下 1.server job ,運行在server 伺服器端,簡單用於邏輯控制的job 可以採用這種方法實現 2.parallel job ,並行啟動並執行job,對於大多數的job develop 採用這種方法來實現 3.sequence job,主要是作流程式控制制用的。 簡單舉例說明: 現在有一個parallel job which named edw_dss_dm_dang.這個job
Time of Update: 2018-08-20
1)Hive資料扭曲問題: 傾斜原因: map輸出資料按Key Hash分配到reduce中,由於key分布不均勻、或者業務資料本身的特點。等原因造成的reduce上的資料量差異過大。 1.1)key分布不均勻 1.2)業務資料本身的特性 1.3)SQL語句造成資料扭曲 解決方案: 1>參數調節: hive.map.aggr=true hive.groupby.skewindata=
Time of Update: 2018-08-20
hive是基於Hadoop的一個資料倉儲工具,可以將結構化的資料檔案映射為一張資料庫表,並提供簡單的sql查詢功能,可以將sql語句轉換為MapReduce任務進行運行。 Metastore (hive中繼資料) Hive將中繼資料存放區在資料庫中,比如mysql ,derby.Hive中的中繼資料套件括表的名稱,表的列和分區及其屬性,表的資料所在的目錄 Hive資料存放區在HDFS,大部分的查詢、計算由mapreduce完成 Hive資料倉儲於資料庫的異同
Time of Update: 2018-08-20
搭建目的 : 用Hbase 用起來更像是關係型資料庫 ,Hbase 本身沒有select ,delete ,where 命令,鍵入phoenix 後可以實現該功能。 Apache 官網 地址 : http://phoenix.apache.org/installation.html Installation To install a pre-built phoenix, use these directions:
Time of Update: 2018-08-20
很久之前就想搞明天的 docker 到底是幹嘛的 ,藉著這夏天火熱的溫度,遊走一番 hub 上註冊一個帳號 https://hub.docker.com/ 下載一個docker 安裝到本地 https://www.docker.com/ windows 下面的安裝 相信大家都能熟練通過 運行案頭上的 Docker Quickstart Terminal 完成最後的配置 ,期間可能會遇到網路問題 ,自行google 常用的命令和造作方法 :
Time of Update: 2018-08-20
擷取手機連絡人的兩種方法 第一種方法比較簡單 就幾句話 但是擷取的資訊不完善 第二種方法比較難 代碼比較多 擷取的資訊全 須要加的許可權 : <uses-permission android:name="android.permission.READ_CONTACTS"/> import java.util.ArrayList; import java.util.List; import
Time of Update: 2018-08-20
verilog數值計算-有符號數和無符號數 位寬截斷 算術運算 有符號數賦值 位寬截斷 位寬大的數賦值給位寬小的數,資料就會被截斷,截斷的規則就是從低位開始取,被截斷的是高位 code wire [5:0] a;wire [4:0] f;localparam data1=5'b11001, data2=5'b11010;assign a=$signed(data1)+$signed(data2);assign f=a;
Time of Update: 2018-08-20
Q1. Name the most common InputFormats defined in Hadoop? Which one is default ?
Time of Update: 2018-08-20
Hive從0.14版本開始支援事務和行級更新,但預設是不支援的,需要一些附加的配置。要想支援行級insert、update、delete,需要配置Hive支援事務。 一、Hive具有ACID語義事務的使用情境 1. 流式接收資料。 許多使用者使用諸如Apache Flume、Apache Storm或Apache
Time of Update: 2018-08-20
運算元最佳化 MapPartitions spark中,最基本的原則,就是每個task處理一個RDD的partition。 MapPartitions操作的優點: 如果是普通的map,比如一個partition中有1萬條資料;ok,那麼你的function要執行和計算1萬次。 但是,使用MapPartitions操作之後,一個task僅僅會執行一次function,function一次接收所有的partition資料。只要執行一次就可以了,效能比較高。
Time of Update: 2018-08-20
http://www.cnblogs.com/biaoyu/archive/2015/06/20/4591304.html BP神經網路推導過程詳解 BP演算法是一種最有效多層神經網路學習方法,其主要特點是訊號前向傳遞,而誤差後向傳播,通過不斷調節網路權重值,使得網路的最終輸出與期望輸出儘可能接近,以達到訓練的目的。 一、多層神經網路結構及其描述 下圖為一典型的多層神經網路。