교양 교수의 눈에 큰 데이터: 멀티, 빠른, 거친, 소비

출처: 인터넷
작성자: 사용자

현재 네트워크 언어, 난 교양 남자. 모 연의 최근 그 문학 과학 그리고 문학 무용은 노벨상의 그의 합격에서 말했다. 나는 문학이 아닌 Uvenko, 교양은 더 광범위 한 설명 하고자, 인문학과 사회 과학으로 더 분할 될 수 있다. 사회 과학 연구 하고있다 항상 데이터 처리, 물론, 작은 데이터, 현재 녹색 개념에 맞춰 지방 자원 뿐만 아니라 낮은, 천천히, 시간이 걸리는, 하지만 좋은 품질의 수 하는 데 사용 됩니다. 작은 데이터를 공부 하 고 몇 년 동안 내 경험을 바탕으로 나는 또한 사회 과학의 합의 대용량 데이터에 대 한 견해의 일부에 대해 m 말하기. 독자는 교양 (또는 사회 과학), 과학, 같이 할 수 있는 뭔가 유용한 동의 수 있습니다.

큰 데이터는 지금 큰 열 이다. 내가 만든 작은 통계, 그리고 Sci/ssci 저널 작년 또는 2에 주로 큰 데이터에 270 연구 논문을 발표 했습니다. 그들의 가장 큰 수 온 27%, 의학 생화학 (20%)와 수학 및 물리학 기초 연구 (11%), 그리고에서 차지 하는 컴퓨터 과학 및 공학 기술에서 적어도 경영학 (8%)과 사회 과학 (7%). 나는 이러한 연구의 마지막 15%를 다루고 있어요.

난 다행히 중국 컴퓨터 학회의 최근에 설립 된 대용량 데이터 전문가 위원회에 참여 하 고 또한 몇 가지 뜨거운 문제 및 큰 데이터 연구 개발 동향의 위원회의 선택에 참가 했다. 내가 그것을 이해, 최근 위원회의 8 핫 이슈와 큰 데이터 연구에 10 동향 이어야 한다 가장 체계적인 전망과 세계에서 식의 일부 지금까지. 물론, 미국 및 유럽 기관, 기업, 학술 그룹 일부 매우 통찰력 있는, 멋진 플레이, 하지만 종합 포인트에서이 첫 번째 문서를 있을 수 있습니다.

큰 데이터의 개념 주의 서 비판을 많이 받았다. 아마도 모두 본이 이야기 하 고 Sybase의 기술 수석, Irfan 칸, "빅 데이터는 큰 거짓말"을 생각 한다. 사이 베이스 데이터베이스 회사, BI 응용 프로그램 도구에 대 한 장기적인 사업입니다. 그들은 하고있다 데이터에서 작업을 많이 그들은 그 느낌이 큰 데이터의 모든 것 이미 거기, 그래서 뭔가 새로운. 그는이 관점에서 조금 과장 된 거품의 비트입니다. 경험적 연구, 사람들이 동의 하지 않는 완전히 그와 함께 다소 과장 되지만 거짓 거짓말에 의해 과장 하지 않는 큰 데이터과 대 광고의 몇 가지 영역이 있습니다.

큰 데이터는 무엇입니까? 가장 인기 있는 정의 4 V:volume, 속도, 다양 한, 값. 내가 생각 하는이 4 v는 대략 "많은, 빠르고 좋은 주" 중국어에서 단어에 관련 된. 이러한 4 개의 단어 중 일부는 이론적으로 달성, 일부 실제로 표시, 하지만 일부는 여전히 격차. 큰 데이터를 정말 많이, 빨리, 좋은, 그리고 성? 내가 조금 아래 그것에 대해 얘기 하자.

큰 데이터의 "다"

큰 데이터는 먼저 데이터 수입니다. 이것은 말을 많이 하 고 이견이 있을 것 같습니다. 설마. 열쇠는 우리가 집계 데이터, 샘플 데이터, 또는 로컬 데이터를 사용 하는 여부 이다. 전체 데이터는 무엇입니까? 가장 직관적인 예제 모든 10 중국과 다른 많은 국가 모든 인구 센서스 결과 전반적인 데이터입니다. 2010 년에서 중국의 마지막 인구 조사는 1.38 십억 사람들을 찾아냈다. 예제 데이터는 쉽게 이해 하 고 샘플링에 의해 얻은 이기도 합니다. 예를 들어 이외에 모든 10 년 인구 조사, 인구 통계, 국가 인구 센터는 천 샘플 설문 조사 당 2 매년 두 인구 10 년 마다 조사 사이 중국 인구 증가 있는 변화를 추정 하는 샘플 데이터를 사용 하 여. 로컬 데이터에 전체 데이터의 하위 집합입니다 하지만 임의의 방법으로 모집단에서 추출 되지 않습니다 그러나, 다양 한 편의 시설 또는 기존의 방법에 의해 얻은 것입니다. 로컬 데이터는 종종 많은 샘플 데이터를 보다 큰 하지만 둘 사이의 엄격한 차이가 있습니다.

이들은 상식입니다. 큰 데이터를 봐 보자. 이론에서는, 큰 데이터 전체 데이터를 의미 합니다. 하지만 사실, 큰 데이터 소유자의 소수를 제외한 기술, 상업, 기밀 및 다른 이유 (Taobao, Sina Weibo, 국가 그리드, 교육 네트워크, 등, 그들은 수 있습니다 실제로 마스터 전체 데이터), 제 3 자, 지금 큰 데이터의 대부분에 대 한 기본적으로 전체 데이터 하지 하지만 로컬 데이터. 참고가 로컬 데이터, 경우에도 그것은 (70%, 80%), 인구의 큰 비율 차지은 전체 데이터도 샘플링된 데이터. 때문에 10% 또는 20%의 경우 누락 된 경우에 로컬 데이터는 일반 인구에서 매우 다른 있을 수 있습니다.

세 가지 종류의 데이터를 경우에 고려 품질, 비용, 효율성 그리고 다른 요인, 전체 데이터는 가장 신뢰할 수 있는 샘플 데이터를 이어서, 가장 신뢰할 수 없는 로컬 데이터는 합니다. 많은 엔지니어링 남자가 마지막 말에 동의 하지 않는 것이 믿습니다. 우리의 보기 샘플 데이터에서에서 규모 훨씬 작습니다, 하지만 사실 로컬 데이터를 보다 안정적이 고 더 귀중 한 수 보다 많은 경우에. 그림 내가 시뮬레이션, 임의로 생성 된 10000 값 (파란색), 전체적으로 살펴보겠습니다. 나는 무작위로 500 값 (빨간색), 스파스는 훈제 (즉, 오류는 크고 정확 하지 않은), 하지만 그것은 X 및 Y 축에는 평균 근원에, 일반 동일은 전반적인 표현에 대 한 좋은. 난 8000 더 값 (즉, 총 80%)의 로컬 데이터 (녹색), 인위적으로 설정 몇 가지 제한 사항이 긍정적인 값 보다 쉽게 연기, 결과 훨씬 더 밀접 하 게 (즉, 오류 작습니다), 상단 오른쪽에, 즉, 평균을 부정확 하지만 정확 하지만. 로컬 데이터에 의존 하는 경우 로컬 데이터의 대량 크기 혼란, 그것은 실제로 사람을 죽이.

역사에서 많은 케이스가 계속 있다, 보여주는 로컬 데이터를 비난. 사회 과학 연구 방법 1936 년 대통령 선거는 미국에서 일반적으로 불린다. 그 당시, 두 회사는 선거 예측을 제작 했다. 하나는 "문학 다이제스트" 보낼 독자 잡지와 잡지 설문 조사, 재활용 2.5 백만 설문. 그 시간 미국 유권자 약 100 백만, 및 2.5 백만 이미 데이터의 매우 큰 부분 이었다. 그들은 공화당 민주당 루스벨트 보다 14% 이었고, 절대 우위와 선출 되었다 예측 분석 되었다. 또 다른 Gallup 투표 센터, 오만명 무작위 샘플링, 루즈벨트는 투표의 56%에서 선출 될 것 이라고 예측 조사 시작 중소기업 이었다. 최종 선거 결과 루즈벨트 격파 브랜든, 또는 갤럽의 작은 샘플 패배 전체 데이터의 문학 다이제스트. 잡지를 주문 하는 사람들이 더 부자가 있기 때문에, 그들은 더 많은 공화당의 지지 했다. 데이터는 크고 unrepresentative, 그리고 결과 더.

정보, 한편으로의 경우의 수에 의해 결정 됩니다, 그리고 다른 한편으로 변수 (즉, 경우의 특성)에 의해 얼마나 많은 느낌. 사회 과학자는 적은 경우와 더 많은 변수를 사용합니다. 많은 변수를 뿐만 아니라 큰 데이터 뿐만 아니라, 더 많은 경우에 이상적입니다. 난 실제 생활에서 큰 데이터는 단지 몇 가지 경우, 많은 변수를 우리의 사회 과학자의 작은 숫자의 반대. 여러 사례와 적은 변수 데이터 구조는 우리가 직면 하는 다 수의 기본적인 현실 이다. 이유 중 하나는 각 사람이 소수의 변수, 데이터의 제도로 알려져 있다. 공유를 통해 통합 여러 경우, 복수 진짜 큰 데이터를 생성할 수 있습니다.

큰 데이터 "빠른"

이제 단위 속도계에 대용량 데이터의 처리 방법 확실히 빠릅니다. 그러나, 그것은 효율성 효과적입니다 말을 재미 있는입니다. 난 아직도을 비교할 느린 예제와 오늘날의 큰 데이터의 기본 방법 중 일부 사회 과학을 사용 합니다. 우리가 할 손 주석, 큰 데이터는 주로 자동 분류. 규모는 비교할 수 없습니다 우리가 일반적으로 샘플만 수천의의 지금 수백만의 작은 데이터, 수십억의 수백은 정상. 고도의 정밀도, 인간 기계를 초과 하지 않습니다. 어떤 사람들 있다 계산, 관찰, 기계 학습 정확도 평균 약 80%, 물론, 일부 자연 언어 처리, 인공 지능 특정 프로젝트는 90%를 할 수 있다 말할 것 이다. 하지만 모든 연구는 평균 80% 더 낙관적인 레코드 수 있습니다. 인공적인 상황에서 기본적으로 할 수 있는 90%, 95%, 일반 사회과학 학술 정기 간행물 95% 논문 아래 정확도 속도 영향을 받지 않습니다.

다른 질문은, 당신은 정확도 비율을 어떻게 압니까? 우리의 일반적인 방법은 두 개 이상의 사람들이 정확도 별도로 추정 하 (즉, 연속, 모르고) 동일한 콘텐츠. 그리고 큰 데이터를 자동 자율된 학습, 결과의 정확성은 경우의 처리는 하지 실제로. 이제 모두 예측을 만들기 위해 온라인 콘텐츠 파악은, 결국에서 예측 정확 하지 않습니다, 그리고 아마도 영원히 알 수 없는입니다. 오류에서 포인트 보기, 판단 오류, 하지만 이러한 오류는 개인적인 오류, 인공의 경우 동시에 여러 사람들이 할, 오류 서로 취소할 수 있습니다. 기계 학습 오류는 만약 당신이 어디로, 체계적인 바이어스, 그것을 쉽게 변경할 수 있습니다 있지만 오류 바이어스가 일반적으로 알려져 있지 않다. 이것은 내가 방금 말한, 끝에서 시스템 오류가 로컬 데이터 문제는 왼쪽, 또는 오른쪽, 높은 또는 낮은 알 수 없습니다. 그래서, 우리의 의견에 따르면 연구의 결과 정확 하 게, 하지만 안정적인 것으로 충분히 정확 하지. 기계 학습 방법은 반대로, 많은 데이터를 매우 정확 하 게 때문입니다. 사실, 단어 정밀 정밀 정확 하 게 올바른 (정확한) 의미 없이 영어만 정확한 의미에서입니다. 정밀은 현재 큰 데이터 문제가 아니다. 그것은 생각 하는 자연 스러운 기계 학습 감독 우리 수동 태그 추가와 자동 분류 할 필요. 기계 학습의 품질은 학습 집합의 품질, 훈련 세트의 규모와 학습의 알고리즘에 의해 결정 됩니다 그리고이 세의 중요성은이 순서에 따라 순위, 가장 중요 한 것은 학습 집합, 즉, 수동 주석의 품질의 품질.

큰 데이터의 "지방"

여기에서 질문은 노동의 저장 여부 또는 에너지 저장. 큰 데이터는 확실히 노동, 저장 하지만 동시에 에너지를 소비 한다. 이 큰 환경 문제 이며 큰 데이터는 엄청난 사실에 대 한 이야기를 시작 하지 않는 전력. 지금 계획을 시작 하 고 관심을 지불 하지 않으면, 어쩌면 몇 년 후 큰 데이터 될 것입니다 새로운 오염 중공업. 나는 수백만의 곳곳에 대규모 데이터 센터에 서버는 들었어요. 우리는 에너지 소비 및 그것에 의해 생성 하는 방사선은 매우 끔찍한 상상할 수 있습니다. 사실, 데이터는 지금 우리의 현재 스토리지 기능 보다 훨씬 빠른 연간 비율로 증가 하 고. 이 경우에, 우리의 저장 물자에 있는 돌파 하 고, 하지 않는 한 우리는 문제를 생각 하는, 우리가 정말 전체 데이터를 저장할 수? 중국 Unicom의 데이터만 4 개월 동안 저장할 수 있습니다 및 다음 새 데이터를 저장 하려면 삭제 해야 합니다. 밖은 여전히 샘플링, 큰 데이터를 작게 하는 것 같아요.

큰 데이터 "좋은"

큰 데이터 작은 데이터 보다 더 나은 것? 질문 모든 문제의 핵심 이며 순간에 응답이 없습니다. 나는 다음 질문을 고려 가치가 있다 생각 한다. 첫째, 큰 데이터는 좋은, 하지만 큰 데이터 어디? 경우 우리가 큰 데이터를 얻을 하지 않습니다, 그것은 창에서 케이크와 그것은 밖에 서 볼 수 있습니다. 우리는 여러 소규모, 중간 규모, 대형-규모 큰 데이터를 나눌 수 있습니다. 소규모 데이터 매우 큰 이며 무료로 얻어질 수 있다입니다. 중간 규모 데이터 무료 또는 저가 대부분의 경우에서 이기도합니다. 실제 메가 규모에 큰 데이터는 없습니다. 할 응용 프로그램 또는 도구의 서비스 모두이 현실을 직면해 야 합니다.

우리 둘째, 처리 하 고 대용량 데이터를 분석 하는 능력을가지고 할? 내가 생각 하는 큰 데이터 분석 도구는 이제 개발 하지, 대부분의 정상적인 데이터를 해결 하기 위해 작은 데이터 문제를 해결 하기 위해 사용 됩니다. 유형이 다른 데이터에 대 한 통계 도구는 지금 크게 없습니다. 과학 저널에 발표 된 최근 기사를 보고 큰 데이터의 상관 관계 2-메타 분석 하는 방법. 당신이 볼 수 있듯이 통계에서 작은 데이터의 2 요소 상관 관계 분석은 100 년 이상 전에. 즉, 대용량 데이터를 처리 하는 능력은 여전히 초기 단계의 작은 데이터 수준에 해당는 1880. 물론, 우리 확실히 할 필요가 없습니다 다른 오늘날의 작은 데이터의 수준에 도달에 큰 데이터 분석 기능을 사용 하려면 120 년을 보내고. 그러나, 우리는 객관적이 고 대용량 데이터 분석 기능의 현재 상황의 충분 한 이해 있어야 합니다.

즉, 큰 데이터 내 시야는 완전히 낙관도 완전히 비관적이 지 않다. 큰 데이터는 확실히 새로운 세기를, 신기의 도착을 나타냅니다. 큰 데이터의 잠재적인 가치 목표 이기도합니다. 하지만 응용 프로그램의 데이터를 공유 하는 데이터의 사실, 많은 문제가 있다. 데이터 저장 및 분석, 사실, 단지 시작입니다. 비즈니스 및 소셜 응용 프로그램 과학적 연구 훨씬 앞서 있다. 과학자와 큰 데이터 연구에 관심이 있는 사회 과학자 잡으려고 시도해 야 한다.

연락처

이 페이지의 내용은 인터넷에서 가져온 것이므로 Alibaba Cloud의 공식 의견이 아닙니다.이 페이지에서 언급 된 제품 및 서비스는 Alibaba Cloud와는 관련이 없으므로이 페이지의 내용이 골칫거리 인 경우 저희에게 알려주십시오. 우리는 5 일 근무일 이내에 이메일을 처리 할 것입니다.

커뮤니티에서 표절 사례를 발견한 경우 info-contact@alibabacloud.com 으로 관련 증거를 첨부하여 이메일을 보내주시기 바랍니다. 당사 직원이 영업일 기준 5일 내에 연락 드리도록 하겠습니다.

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.