概要

ビッグデータ (Big Data)

DAMA-DMBOK 2nd Edition — Chapter 14: Big Data and Data Science

出題割合: 2%(約2問)


1. ビッグデータとは

定義: 従来のデータ管理ツールでは処理・格納・分析が困難なほど大量・多種・高速に生成されるデータ。

ビッグデータの4V(または5V)

V 概念 説明
Volume(量) 大量のデータ テラバイト〜エクサバイトクラス
Velocity(速度) 生成・処理速度が高い ストリーミング・リアルタイム
Variety(多様性) 多様な形式 構造化・半構造化・非構造化
Veracity(信頼性) データの正確さ・信頼性 不確実性・ノイズの管理
Value(価値) 分析による価値創出 ビジネス価値への変換

2. ビッグデータの処理パターン

バッチ処理 vs ストリーム処理

方式 特徴 技術
バッチ処理 大量データを一括処理 Hadoop MapReduce, Spark
ストリーム処理 リアルタイム・継続処理 Apache Kafka, Apache Flink, Spark Streaming

主要技術スタック

技術 役割
Hadoop HDFS 分散ファイルシステム(大量データ格納)
Apache Spark 高速分散処理エンジン(バッチ+ストリーム)
Apache Kafka 分散メッセージキュー(ストリーミング)
Apache Hive Hadoop上でのSQL実行
Apache HBase NoSQL列指向DB(Hadoop上)

3. データサイエンスとの関係

データサイエンスのプロセス(CRISP-DM)

Business Understanding → Data Understanding → Data Preparation → 
Modeling → Evaluation → Deployment
フェーズ 内容
Business Understanding ビジネス目標の定義
Data Understanding データ収集・探索
Data Preparation 前処理・特徴量エンジニアリング
Modeling モデル構築・学習
Evaluation モデル評価
Deployment 本番環境への展開

試験ポイント