セクション2:データの取り込みと処理(~25%)★最重要
データを「取り込み・変換・運用化」する中核工程を扱います。出題比重が全セクション中で最も高いため、最優先で深く学習します。バッチ/ストリーミングの違い、Dataflow(Apache Beam)のウィンドウ・ウォーターマーク・トリガー、サービスの使い分け(Dataflow/Dataproc/Data Fusion)、Pub/Sub、オーケストレーション(Composer/Workflows)、CI/CD が核心です。
このフォルダの構成
| ファイル | 内容 | 対象 |
|---|---|---|
| 01_基礎.md | 各サブトピックの概念とサービスの役割 | 📘 全員 |
| 02_応用.md | 設計判断・ベストプラクティス・トレードオフ・ひっかけ | 🔧🎯 中堅・シニア |
| 03_要点と暗記.md | 暗記事項・意思決定の型・ミニ確認問題 | 全員(直前確認) |
学習目標(このセクションを終えたら)
- バッチ処理とストリーミング処理の本質的な違いと選択基準を説明できる
- ソース・シンク・変換・オーケストレーションを軸にパイプラインを計画できる
- Dataflow / Dataproc / Cloud Data Fusion を要件から正しく使い分けられる
- Apache Beam のウィンドウ(固定/スライディング/セッション)を説明できる
- ウォーターマーク・トリガー・遅延到着データ・Exactly-once 処理を説明できる
- Dataflow Shuffle / Streaming Engine の役割を言える
- Pub/Sub の順序指定キー・デッドレター・シーク・Pub/Sub Lite との違いを説明できる
- AI によるデータエンリッチメント(BigQuery ML.GENERATE_TEXT 等)の使いどころを言える
- Cloud Composer(Airflow/DAG)と Workflows を使い分けられる
- Cloud Build によるパイプラインの CI/CD を説明できる
公式試験ガイドの対応範囲
- 2.1 データパイプラインの計画(ソースとシンク、変換・オーケストレーションロジック、ネットワーキング基礎、データ暗号化)
- 2.2 パイプラインの構築(データクレンジング、サービス選定、変換=バッチ/ストリーミング/処理ロジック/AIエンリッチメント、データ取得とインポート、新規データソース統合)
- 2.3 パイプラインのデプロイと運用化(ジョブ自動化とオーケストレーション、CI/CD)
学習後は 問題集セクション2 で理解度を確認してください。