シラバス詳細

シラバス詳細 — Professional Data Engineer

公式試験ガイド(2024年改訂版)の全範囲を日本語化し、各項目に**「何が問われるか」「キーサービス」**を補足したものです。 学習前にここで地図を頭に入れ、各論は 02_学習資料/ で深掘りしてください。

凡例:🔑 = 頻出キーサービス/⚠️ = ひっかけ・判断ポイント


📐 セクション1:データ処理システムの設計(~22%)

データ基盤を「設計」する観点。セキュリティ・信頼性・移行を含む上流工程。

1.1 セキュリティとコンプライアンスを考慮した設計

🔑 Cloud IAM / 組織ポリシー / CMEK・CSEK / Cloud KMS / Cloud DLP / VPC Service Controls ⚠️ 「最小権限」「サービス境界での情報漏洩防止 (VPC SC)」「PIIはDLPでマスキング/トークン化」が定番解答

1.2 信頼性と忠実性を考慮した設計

🔑 Dataform / Dataflow / Cloud Data Fusion / Cloud Composer ⚠️ ACIDが必要 → Spanner/Cloud SQL/AlloyDB、結果整合性で良い → Bigtable/Firestore

1.3 柔軟性とポータビリティを考慮した設計

🔑 BigLake / BigQuery Omni(マルチクラウド)/ Dataplex / Dataplex Catalog ⚠️ マルチクラウドのデータをBigQueryから直接分析 → BigQuery Omni / BigLake

1.4 データ移行の設計

🔑 BigQuery Data Transfer Service / Database Migration Service (DMS) / Transfer Appliance / Datastream / Storage Transfer Service ⚠️ 大容量オフライン転送 → Transfer Appliance、継続的CDC → Datastream、DB移行 → DMS


🔄 セクション2:データの取り込みと処理(~25%)★最重要

パイプラインの計画・構築・運用。出題比重が最も高いため最優先で学習。

2.1 データパイプラインの計画

🔑 Pub/Sub / Dataflow / Cloud Storage / BigQuery

2.2 パイプラインの構築

🔑 Dataflow (Apache Beam) / Dataproc (Spark/Hadoop) / Cloud Data Fusion / Pub/Sub / BigQuery ⚠️ ストリーミング+サーバーレス → Dataflow、既存Spark/Hadoop資産の移行 → Dataproc、GUIでETL → Data Fusion ⚠️ ストリーミングのウィンドウ(固定/スライディング/セッション)とウォーターマーク・遅延データ処理は頻出

2.3 パイプラインのデプロイと運用化

🔑 Cloud Composer (Airflow) / Workflows / Cloud Build ⚠️ 複雑な依存関係のあるDAG → Composer、軽量なAPIオーケストレーション → Workflows


💾 セクション3:データの保存(~20%)

ストレージ選定とDWH/データレイク/データプラットフォーム設計。

3.1 ストレージシステムの選択

🔑 上記全サービス(選定の使い分けが核心) ⚠️ 意思決定ツリーは丸暗記必須(後述)

3.2 データウェアハウスの利用計画

🔑 BigQuery(パーティション・クラスタリング・非正規化・ネスト/繰り返しフィールド) ⚠️ BigQueryは非正規化+ネスト構造が基本(JOINよりSTRUCT/ARRAY)

3.3 データレイクの利用

🔑 Cloud Storage / Dataplex / BigLake

3.4 データプラットフォームの設計

🔑 Dataplex / Dataplex Catalog(データメッシュ的な統合ガバナンス)


📊 セクション4:分析のためのデータ準備と使用(~15%)

BI可視化・AI/ML向け前処理・データ共有。

4.1 可視化のためのデータ準備

🔑 Looker / Looker Studio / BI Engine / マテリアライズドビュー / 承認済みビュー (Authorized Views) ⚠️ 行/列レベルのアクセス制御、列マスキング(ポリシータグ)

4.2 AI・ML のためのデータ準備

🔑 BigQuery ML / Vertex AI / Feature Store / Vector Search(埋め込み・RAG) ⚠️ SQLだけでML → BigQuery ML、本格MLOps → Vertex AI

4.3 データの共有

🔑 Analytics Hub / 承認済みビュー / IAM ⚠️ 組織間でのデータ共有 → Analytics Hub(データのコピー不要)


⚙️ セクション5:データワークロードの保守と自動化(~18%)

運用フェーズ。コスト最適化・自動化・監視・耐障害性。

5.1 リソースの最適化

🔑 Dataproc(ephemeral クラスタ)/ プリエンプティブル VM / BigQuery スロット ⚠️ コスト最適化 → Dataprocはジョブ完了後に破棄するephemeralクラスタ+Cloud Storage

5.2 自動化と再現性の設計

🔑 Cloud Composer (Airflow) / Workflows / Cloud Scheduler

5.3 ビジネス要件に基づくワークロードの編成

🔑 BigQuery Editions (Standard/Enterprise/Enterprise Plus) / スロット予約 ⚠️ 予測可能な大量クエリ → 定額(Editions/予約)、散発的 → オンデマンド

5.4 プロセスの監視とトラブルシューティング

🔑 Cloud Monitoring / Cloud Logging / BigQuery INFORMATION_SCHEMA / 管理リソースチャート

5.5 障害の認識と影響の軽減

🔑 マルチリージョン / Cloud SQL HA・リードレプリカ / Memorystore (Redis) クラスタ ⚠️ Dataflowのスナップショット、Pub/Subのシーク、BigQueryのタイムトラベル(7日間)


🎯 学習優先度マトリクス

セクション 比重 難易度 学習優先度
2. 取り込みと処理 25% ⭐⭐⭐⭐⭐
1. システム設計 22% ⭐⭐⭐⭐
3. データの保存 20% ⭐⭐⭐⭐
5. 保守と自動化 18% ⭐⭐⭐
4. 分析準備 15% 低〜中 ⭐⭐⭐

戦略:比重の高いセクション2・3(ストレージ選定+パイプライン)で確実に得点する。これだけで約45%を占める。次に設計(1)。4・5は範囲が広いが深さは浅めなので、サービスの役割を押さえて取りこぼさない。