練習問題

練習問題:ビッグデータ

Q1. ビッグデータの4Vのうち、データのリアルタイム生成・処理速度の高さを表すのはどれか?

A) Volume B) Velocity C) Variety D) Veracity

Q2. CRISP-DMモデルにおいて、モデルを構築・学習するフェーズはどれか?

A) Data Understanding B) Data Preparation C) Modeling D) Evaluation

Q3. Apache Spark の主な特徴はどれか?

A) リレーショナルDBの一種で、SQLでデータ操作する
B) 分散処理エンジンで、バッチ処理とストリーム処理の両方に対応する
C) データカタログツールで、メタデータを管理する
D) クラウド向けのETLサービスである


解答

A1. B) Velocity — 速度。スマートフォンのログ・IoTセンサーデータ・SNSの投稿等が高速に生成される
A2. C) Modeling — CRISP-DM: Business Understanding → Data Understanding → Data Preparation → Modeling → Evaluation → Deployment
A3. B) 分散処理エンジン(バッチ+ストリーム) — Sparkはin-memory処理でHadoop MapReduceより高速。バッチとストリーム両対応