← メインに戻る
Topic 13

ビッグデータ

DAMA-DMBOK 2nd Edition — Chapter 14: Big Data and Data Science

出題割合 2%(約2問)
ビッグデータとは

定義: 従来のデータ管理ツールでは処理・格納・分析が困難なほど 大量・多種・高速 に生成されるデータ。

ビッグデータの 4V(または5V)
V
Volume
テラバイト〜エクサバイトクラス
V
Velocity
速度
ストリーミング・リアルタイム生成
V
Variety
多様性
構造化・半構造化・非構造化
V
Veracity
信頼性
不確実性・ノイズの管理
V
Value
価値(5V目)
ビジネス価値への変換
処理パターン:バッチ処理 vs ストリーム処理
バッチ処理

大量データを一括・定期的に処理

Hadoop MapReduce Apache Spark
ストリーム処理

リアルタイム・継続的に処理

Apache Kafka Apache Flink Spark Streaming
主要技術スタック
技術役割分類
Hadoop HDFS 分散ファイルシステム(大量データ格納) ストレージ
Apache Spark 高速分散処理エンジン(バッチ+ストリーム) 処理エンジン
Apache Kafka 分散メッセージキュー(ストリーミング) ストリーミング
Apache Hive Hadoop上でのSQL実行 クエリ
Apache HBase NoSQL列指向DB(Hadoop上) NoSQL
データサイエンスプロセス:CRISP-DM
Business
Understanding
Data
Understanding
Data
Preparation
Modeling
Evaluation
Deployment
フェーズ内容
Business Understandingビジネス目標の定義・問題設定
Data Understandingデータ収集・探索(EDA)
Data Preparation前処理・特徴量エンジニアリング
Modelingモデル構築・学習(★試験頻出)
Evaluationモデル評価・検証
Deployment本番環境への展開
⚡ 試験ポイント(必ず押さえる)
ビッグデータ 4V/5V 早見表
V英語日本語キーポイント重要度
V1 Volume テラバイト〜エクサバイトクラス 重要
V2 Velocity 速度 ストリーミング・リアルタイム処理 ★最頻出 最重要
V3 Variety 多様性 構造化・半構造化・非構造化データ 重要
V4 Veracity 信頼性 不確実性・ノイズ・データ品質の問題 重要
V5 Value 価値 ビジネス価値への変換(追加の5V目) 参考
CRISP-DM フェーズ(順序を覚える)
// データサイエンスの標準プロセスモデル

1. Business Understanding // ビジネス目標の定義
2. Data Understanding // データ収集・探索
3. Data Preparation // 前処理・特徴量エンジニアリング
4. Modeling // モデル構築・学習 ★試験頻出フェーズ
5. Evaluation // モデル評価
6. Deployment // 本番環境への展開
処理方式 比較
方式技術
バッチ Hadoop MapReduce, Apache Spark
ストリーム Apache Kafka, Apache Flink, Spark Streaming
主要技術 役割
技術役割
Hadoop HDFS分散ファイルシステム
Apache Spark高速分散処理(両方対応)
Apache Kafka分散メッセージキュー
Apache HiveHadoop上SQL実行
重要キーワード
Volume(量) Velocity(速度) Variety(多様性) Veracity(信頼性) Value(価値) CRISP-DM Hadoop HDFS Apache Spark Apache Kafka ストリーム処理 バッチ処理 Modeling フェーズ
スコア
0 / 3
Q1. ビッグデータの4Vのうち、データのリアルタイム生成・処理速度の高さを表すのはどれか?
正解: B) Velocity
Velocity = 速度。スマートフォンのログ・IoTセンサーデータ・SNSの投稿などが高速に生成されることを指す。 Volume(量)、Variety(多様性)、Veracity(信頼性)と混同しないこと。
Q2. CRISP-DMモデルにおいて、モデルを構築・学習するフェーズはどれか?
正解: C) Modeling
CRISP-DM: Business Understanding → Data Understanding → Data Preparation → Modeling → Evaluation → Deployment。 Modelingフェーズでモデルを構築・学習する。EvaluationはModelingの後の評価フェーズ。
Q3. Apache Spark の主な特徴はどれか?
正解: B) 分散処理エンジン(バッチ+ストリーム)
Sparkはin-memory処理でHadoop MapReduceより高速。バッチとストリーム処理の両方に対応するのが最大の特徴。 Kafkaはストリーミング専用のメッセージキュー。