ビッグデータ (Big Data)
DAMA-DMBOK 2nd Edition — Chapter 14: Big Data and Data Science
出題割合: 2%(約2問)
1. ビッグデータとは
定義: 従来のデータ管理ツールでは処理・格納・分析が困難なほど大量・多種・高速に生成されるデータ。
ビッグデータの4V(または5V)
| V |
概念 |
説明 |
| Volume(量) |
大量のデータ |
テラバイト〜エクサバイトクラス |
| Velocity(速度) |
生成・処理速度が高い |
ストリーミング・リアルタイム |
| Variety(多様性) |
多様な形式 |
構造化・半構造化・非構造化 |
| Veracity(信頼性) |
データの正確さ・信頼性 |
不確実性・ノイズの管理 |
| Value(価値) |
分析による価値創出 |
ビジネス価値への変換 |
2. ビッグデータの処理パターン
バッチ処理 vs ストリーム処理
| 方式 |
特徴 |
技術 |
| バッチ処理 |
大量データを一括処理 |
Hadoop MapReduce, Spark |
| ストリーム処理 |
リアルタイム・継続処理 |
Apache Kafka, Apache Flink, Spark Streaming |
主要技術スタック
| 技術 |
役割 |
| Hadoop HDFS |
分散ファイルシステム(大量データ格納) |
| Apache Spark |
高速分散処理エンジン(バッチ+ストリーム) |
| Apache Kafka |
分散メッセージキュー(ストリーミング) |
| Apache Hive |
Hadoop上でのSQL実行 |
| Apache HBase |
NoSQL列指向DB(Hadoop上) |
3. データサイエンスとの関係
データサイエンスのプロセス(CRISP-DM)
Business Understanding → Data Understanding → Data Preparation →
Modeling → Evaluation → Deployment
| フェーズ |
内容 |
| Business Understanding |
ビジネス目標の定義 |
| Data Understanding |
データ収集・探索 |
| Data Preparation |
前処理・特徴量エンジニアリング |
| Modeling |
モデル構築・学習 |
| Evaluation |
モデル評価 |
| Deployment |
本番環境への展開 |
試験ポイント
- 4V(または5V): Volume / Velocity / Variety / Veracity(/ Value)
- バッチ vs ストリーム処理の違い
- Hadoop = 分散処理フレームワーク
- CRISP-DM = データサイエンスの標準プロセス