통합 전략
데이터 통합 비즈니스 사용자에 게 다른 산업 행동 고객 행동 데이터 처리 방법을 공부 하 고 다른 시스템에서 데이터의 조합을 말합니다. 데이터 통합의 초기에, 데이터 거래 시스템 및 그들의 애플 리 케이 션을 수 있었습니다. 비즈니스 결정의 개발은 결정 플랫폼으로 안내 하 고 결정 플랫폼을 만드는 기초를 제공 하는 제한 된 데이터 집합.
데이터 용량 및 데이터 형식을 데이터 창 고에서 처음, 그리고 인프라 기술 및 기술 분석 및 데이터 저장소 요구 사항에 맞게 지난 30 년 동안 극적으로 성장 했다. 이 모든 데이터 통합에 대 한 전망을 혁명을 했다.
전통적인 데이터 통합 기술 ETL, ELT, CDC 및 EAI 종류의 건축과 관련 된 프로그래밍 모델에 중점을 둡니다. 그러나, 큰 데이터 환경에서는 이러한 기술이 필요가 수정 같은 크기와 복잡성, 처리 될 데이터 형식을 포함 하 여 요구 사항에 따라. 대용량 데이터 처리를 달성 하기 위해 두 가지 단계를 거칩니다. 첫 번째 단계는 분석 및 데이터 처리의 디자인을 포함 하는 데이터 기반 아키텍처를 구현 하는. 두 번째 단계는 다음 섹션에서 소개 하는 실제 아키텍처 구현입니다.
데이터 기반 통합
모든 기업에서 데이터 데이터 형식에 따라 먼저 정렬 됩니다 다음-세대 데이터 웨어하우스, 건물의 기술에서 고려의 특성 자체는 데이터 및 관련된 처리 요구 사항을. 데이터 처리는 일련의 프로세스를 프로그래밍, 엔터프라이즈 메타 데이터, MDM, 시맨틱 기술 (분사 기술)를 사용 하 여 통합 프로세스 논리에 내장 된 비즈니스 규칙을 사용 합니다.
그림 10.3 다양 한 종류의 데이터 항목 데이터 처리의 프로세스를 보여 줍니다. 모델 형식 및 데이터의 구조에 따라 데이터 형식을 먼저 분할 고 ETL, ELT, CDC, 또는 텍스트 처리 기술에서 다양 한 수준에서 처리 하는 규칙을 밖으로. 다음으로, 데이터 통합 아키텍처와 그 혜택을 분석 해 보겠습니다.
그림 1
데이터 분류
그림 1에서 보듯이 데이터는 다음 범주로 대략 분할 될 수 있다:
트랜잭션 처리 데이터입니다. 같은 전형적인 OLTP 데이터입니다.
웹 응용 프로그램 데이터입니다. 같은 웹 응용 프로그램을 개발 하는 조직에 의해 생성 된 데이터입니다. 포함 하는이 데이터 스트림 데이터, 웹 영업 데이터 및 고객 관계를 클릭 하 고 호출 센터 전화 데이터.
Edw 데이터입니다. 이것은 조직의 현재 데이터 웨어하우스에서 기존 데이터 이다. 그것은 저장 하 고 비즈니스 사용자에 대 한 데이터를 처리 하는 조직에서 다양 한 데이터 웨어하우스 및 데이터 마트를 포함할 수 있습니다.
데이터를 분석 합니다. 이러한 데이터는 현재 조직에 의해 배치 하는 분석 시스템에서 파생 됩니다. 이러한 데이터는 지금 주로 EDW 또는 기반 트랜잭션 데이터.
구조화 되지 않은 데이터입니다. 이 큰 범주 포함 됩니다.
텍스트: 문서, 노트, 노트북, 및 연락처
이미지: 사진, 차트 및 그래프
비디오: 기업 및 조직에 관련 된 고객 비디오
소셜 미디어: 페이 스 북, 트위터, Instagram, 링크 드 인, 포럼, YouTube 및 커뮤니티 사이트
오디오: 콜 센터 전화, 방송
센서 데이터: 사업 범위와 관련 된 다양 한 장치에서 센서 데이터를 포함 한다. 에너지 기업, 물류 및 유통 업체 (UPS 및 페덱스) 트럭과 자동차 센서에 대 한 데이터를 생성 하는 동안 예를 들어 지능형 계측기에 대 한 데이터를 생성.
날씨 데이터: 현대 비즈니스-비즈니스와 비즈니스-투-소비자 기업 날씨 데이터를 사용 하 여 비즈니스에 날씨의 영향을 분석, 예측 분석의 중요 한 요소가 되고있다.
과학적 데이터: 의료, 제약, 보험, 의료 및 금융 서비스에 적용, 이러한 영역은 필요 컴퓨팅 기능, 모델링 및 생성 모델을 포함 하 여 복잡 한 데이터.
주식 시장 데이터: 많은 그것을 사용 하 여 재무 데이터, 예측된 시장 동향, 금융 위험, 처리 조직과 보험 계산을 수행.
반 구조화 된 데이터입니다. 이 전자 메일, 프레 젠 테이 션, 수학적 모델, 그래픽, 및 지리적 데이터를 포함합니다.
스키마
식별 하 고 서로 다른 데이터 형식을 구성, 후 다양 한 데이터 특성을 포함 하 여 데이터 형식, 연결 된 메타 데이터, 기본 데이터 요소, 데이터 복잡성, 확인할 수 있는 중요 한 데이터 요소 및 비즈니스 사용자가 소유 하 고 관리 데이터 명확 하 게 식별할 수 있습니다.
작업 부하
대용량 데이터 처리에 대 한 가장 큰 요구는 이전 섹션에 설명 된 대로 작업 관리입니다.
그림 2
데이터 아키텍처와 분류, 우리는 데이터의이 유형에 대 한 작업 부하 요구 사항을 수행할 수 있는 인프라를 할당할 수 있습니다.
우리가 대략 데이터 용량 및 데이터 대기 시간 (그림 2)에 따라 4 가지 범주로 작업을 나눌 수 있습니다. 우리는 다음 범주에 따라 물리적 인프라 계층에 데이터를 할당 합니다. 이 관리 방법의 현재와 미래의 새로운 기본 방법 효율적으로 이용할 수 있는 데이터 웨어하우스의 다양 한 부분에 대 한 동적, 확장성 요구를 만듭니다. 알고 있어야 하는 중요 한 문제는이 시점에서 다른 작업에 동일한 데이터를 그룹화 할 수 있도록 데이터 처리 긴급에 따라 분류 됩니다 때문에 그것은 다른 물리적 인프라 구성 요소에 기능을 할 수 있도록 처리 논리의 유연성을 유지 하는 것입니다.
작업 스키마 추가 혼합된 작업 관리에 대 한 조건을 결정 하 고 다른 작업에서 데이터를 함께 처리 됩니다.
예를 들어 일반적으로, 데이터 및 환경에서 그 중의 한 종류와 함께 작동 하도록 하기만 하 고 높은 용량, 낮은 대기 시간 데이터와 낮은 용량 높은 대기 시간 데이터를 함께 처리 하는 경우 데이터 처리 환경 다양 한 압력의 밑 됩니다. 동시 또는 높은 주파수 사용자 쿼리 및 데이터 로드 더 빠르게 제어를 잃게 하 고 다음 전체 성능에 영향을 미칠 수 있는 데이터 처리의 복잡성을 증가. 인프라 모두 크고 전통적인 데이터 플러스 이러한 복잡성을 처리 하는 경우 문제는 더 악화.
나눈 작업의 목표 데이터 처리 및 다음-세대 데이터 웨어하우스의 인프라 디자인의 위험을 줄일 수 방법의 복잡성을 결정 하는.
(책임 편집기: 유산의 좋은)