ビッグデータとは
定義: 従来のデータ管理ツールでは処理・格納・分析が困難なほど
大量・多種・高速 に生成されるデータ。
ビッグデータの 4V(または5V)
V
Volume
量
テラバイト〜エクサバイトクラス
V
Velocity
速度
ストリーミング・リアルタイム生成
V
Variety
多様性
構造化・半構造化・非構造化
V
Veracity
信頼性
不確実性・ノイズの管理
V
Value
価値(5V目)
ビジネス価値への変換
処理パターン:バッチ処理 vs ストリーム処理
バッチ処理
大量データを一括・定期的に処理
Hadoop MapReduce
Apache Spark
ストリーム処理
リアルタイム・継続的に処理
Apache Kafka
Apache Flink
Spark Streaming
主要技術スタック
技術 役割 分類
Hadoop HDFS
分散ファイルシステム(大量データ格納)
ストレージ
Apache Spark
高速分散処理エンジン(バッチ+ストリーム)
処理エンジン
Apache Kafka
分散メッセージキュー(ストリーミング)
ストリーミング
Apache Hive
Hadoop上でのSQL実行
クエリ
Apache HBase
NoSQL列指向DB(Hadoop上)
NoSQL
データサイエンスプロセス:CRISP-DM
Business Understanding
→
Data Understanding
→
Data Preparation
→
Modeling
→
Evaluation
→
Deployment
フェーズ 内容
Business Understanding ビジネス目標の定義・問題設定
Data Understanding データ収集・探索(EDA)
Data Preparation 前処理・特徴量エンジニアリング
Modeling モデル構築・学習(★試験頻出)
Evaluation モデル評価・検証
Deployment 本番環境への展開
⚡ 試験ポイント(必ず押さえる)
4V(または5V) : Volume / Velocity / Variety / Veracity(/ Value)— 各Vの日本語訳と意味を暗記
Velocity = データのリアルタイム生成・処理速度の高さ(ストリーミング)
バッチ vs ストリーム の違い: バッチ=一括処理、ストリーム=継続リアルタイム処理
Apache Spark = バッチとストリーム処理の両方に対応する高速分散処理エンジン
CRISP-DM = データサイエンスの標準プロセス(6フェーズの順序を覚える)
Hadoop = 分散処理フレームワーク(HDFS がストレージ、MapReduce が処理)
ビッグデータ 4V/5V 早見表
V 英語 日本語 キーポイント 重要度
V1
Volume
量
テラバイト〜エクサバイトクラス
重要
V2
Velocity
速度
ストリーミング・リアルタイム処理 ★最頻出
最重要
V3
Variety
多様性
構造化・半構造化・非構造化データ
重要
V4
Veracity
信頼性
不確実性・ノイズ・データ品質の問題
重要
V5
Value
価値
ビジネス価値への変換(追加の5V目)
参考
CRISP-DM フェーズ(順序を覚える)
// データサイエンスの標準プロセスモデル
1. Business Understanding // ビジネス目標の定義
2. Data Understanding // データ収集・探索
3. Data Preparation // 前処理・特徴量エンジニアリング
4. Modeling // モデル構築・学習 ★試験頻出フェーズ
5. Evaluation // モデル評価
6. Deployment // 本番環境への展開
処理方式 比較
方式 技術
バッチ
Hadoop MapReduce, Apache Spark
ストリーム
Apache Kafka, Apache Flink, Spark Streaming
主要技術 役割
技術 役割
Hadoop HDFS 分散ファイルシステム
Apache Spark 高速分散処理(両方対応)
Apache Kafka 分散メッセージキュー
Apache Hive Hadoop上SQL実行
重要キーワード
Volume(量)
Velocity(速度)
Variety(多様性)
Veracity(信頼性)
Value(価値)
CRISP-DM
Hadoop HDFS
Apache Spark
Apache Kafka
ストリーム処理
バッチ処理
Modeling フェーズ
Q1.
ビッグデータの4Vのうち、データのリアルタイム生成・処理速度の高さを表すのはどれか?
A Volume
B Velocity
C Variety
D Veracity
正解: B) Velocity
Velocity = 速度。スマートフォンのログ・IoTセンサーデータ・SNSの投稿などが高速に生成されることを指す。
Volume(量)、Variety(多様性)、Veracity(信頼性)と混同しないこと。
Q2.
CRISP-DMモデルにおいて、モデルを構築・学習するフェーズはどれか?
A Data Understanding
B Data Preparation
C Modeling
D Evaluation
正解: C) Modeling
CRISP-DM: Business Understanding → Data Understanding → Data Preparation → Modeling → Evaluation → Deployment。
Modelingフェーズでモデルを構築・学習する。EvaluationはModelingの後の評価フェーズ。
Q3.
Apache Spark の主な特徴はどれか?
A リレーショナルDBの一種で、SQLでデータ操作する
B 分散処理エンジンで、バッチ処理とストリーム処理の両方に対応する
C データカタログツールで、メタデータを管理する
D クラウド向けのETLサービスである
正解: B) 分散処理エンジン(バッチ+ストリーム)
Sparkはin-memory処理でHadoop MapReduceより高速。バッチとストリーム処理の両方に対応するのが最大の特徴。
Kafkaはストリーミング専用のメッセージキュー。