練習問題:ビッグデータ
Q1. ビッグデータの4Vのうち、データのリアルタイム生成・処理速度の高さを表すのはどれか?
A) Volume B) Velocity C) Variety D) Veracity
Q2. CRISP-DMモデルにおいて、モデルを構築・学習するフェーズはどれか?
A) Data Understanding B) Data Preparation C) Modeling D) Evaluation
Q3. Apache Spark の主な特徴はどれか?
A) リレーショナルDBの一種で、SQLでデータ操作する
B) 分散処理エンジンで、バッチ処理とストリーム処理の両方に対応する
C) データカタログツールで、メタデータを管理する
D) クラウド向けのETLサービスである
解答
A1. B) Velocity — 速度。スマートフォンのログ・IoTセンサーデータ・SNSの投稿等が高速に生成される
A2. C) Modeling — CRISP-DM: Business Understanding → Data Understanding → Data Preparation → Modeling → Evaluation → Deployment
A3. B) 分散処理エンジン(バッチ+ストリーム) — Sparkはin-memory処理でHadoop MapReduceより高速。バッチとストリーム両対応