PDE 合格対策

用語集

PDE頻出のサービス・概念をカテゴリ別にまとめたリファレンス。試験は日本語受験可ですが、選択肢やサービス名は英語ベース。日英対応を意識して暗記しましょう。

0 件を表示中

💡 暗記のコツサービスは「役割の動詞」で覚える(BigQuery=分析する/Pub/Sub=受け取る/Dataflow=処理する/Composer=束ねる)。似たサービスはペアで対比(Dataflow⇔Dataproc、Composer⇔Workflows、Spanner⇔Bigtable、CMEK⇔CSEK、DMS⇔Datastream)。

🗂️ 1. ストレージ系サービス

サービス種別説明主な使いどころ
BigQueryDWH (OLAP)サーバーレスなデータウェアハウス。ペタバイト級の分析クエリを高速実行大規模分析・BI・ML(BQML)
Cloud Storage (GCS)オブジェクトストレージ非構造化データの保存。Standard/Nearline/Coldline/Archiveのクラスデータレイク・バックアップ・ステージング
Cloud SQLRDB (OLTP)マネージドなMySQL/PostgreSQL/SQL Server。リージョナル中小規模のトランザクション、Webアプリ
AlloyDBRDB (OLTP/HTAP)PostgreSQL互換の高性能DB。分析も速いPostgreSQL互換で高負荷・分析併用
Spanner分散RDBグローバル分散・水平スケール・強整合のRDB。TrueTime使用グローバル規模・無停止・強整合が必要なOLTP
BigtableNoSQL (ワイドカラム)低レイテンシ・高スループットのKVS。HBase API互換時系列・IoT・大量書き込み、ミリ秒応答
FirestoreNoSQL (ドキュメント)スケーラブルなドキュメントDB。モバイル/Web向け同期モバイルアプリ・リアルタイム同期
MemorystoreインメモリマネージドRedis/Memcachedキャッシュ・セッション・低レイテンシ
BigLakeストレージエンジンGCS/他クラウド上のデータをBigQueryから統一的に扱うデータレイク統合・マルチクラウド分析

⚙️ 2. データ処理・パイプライン系

サービス/用語説明使いどころ
DataflowApache Beamベースのサーバーレスなバッチ/ストリーミング処理ストリーミング・統一パイプライン・自動スケール
Apache Beamバッチ/ストリーミングを統一するプログラミングモデルDataflowの実体。PCollection/PTransform
DataprocマネージドなSpark/Hadoopクラスタ既存Spark/Hadoop資産の移行、ephemeralクラスタ
Cloud Data FusionGUIベースのETL/ELTツール(CDAPベース)ノーコード/ローコードでパイプライン構築
DataformBigQuery内のELT・SQL変換をバージョン管理BQ内のデータ変換・依存管理・テスト
Pub/Subグローバルなメッセージング(pub-subモデル)ストリーミングの取り込み・イベント連携
Pub/Sub Liteゾーン単位の低コスト版Pub/Subコスト優先・高スループットの取り込み
Apache Kafka分散ストリーミングプラットフォーム(OSS)既存Kafka資産(Managed Service for Kafka)
DatastreamサーバーレスなCDC(変更データキャプチャ)DBの変更をリアルタイムにBQ/GCSへ複製
バッチ処理蓄積したデータをまとめて処理。スループット重視日次集計・大量変換
ストリーミング処理データ到着ごとにリアルタイム処理。レイテンシ重視リアルタイム分析・異常検知
ウィンドウ (Windowing)ストリームを時間で区切る単位。固定/スライディング/セッションストリーミング集計
ウォーターマーク (Watermark)「この時刻までのデータは到着した」と見なす境界遅延データの判定
遅延到着データ (Late data)ウォーターマーク後に届くデータ。トリガー/許容遅延で制御ストリーミングの正確性
トリガー (Trigger)ウィンドウの結果をいつ出力するかの制御早期/遅延発火
Exactly-once各レコードを重複なく正確に1回処理する保証Dataflowの処理保証
Dataflow Shuffleシャッフル処理をサービス側で実行しVM負荷を下げるバッチの効率化

🔀 3. オーケストレーション・運用系

サービス/用語説明使いどころ
Cloud ComposerマネージドApache Airflow。DAGでワークフロー管理複雑な依存関係のあるジョブ群
WorkflowsサーバーレスなAPIオーケストレーション(YAML/JSON)軽量なサービス連携・HTTP/APIの順次実行
Cloud Schedulercronベースのジョブスケジューラ定期実行のトリガー
DAG有向非巡回グラフ。タスクの依存関係を表現(Airflow)Composerのワークフロー定義
Cloud BuildCI/CDのビルド・テスト・デプロイ自動化パイプラインのCI/CD
Cloud Monitoringメトリクス監視・アラート・ダッシュボード可観測性(メトリクス)
Cloud Loggingログの収集・検索・分析可観測性(ログ)
INFORMATION_SCHEMABigQueryのメタデータビュー(ジョブ/使用量等)クエリ/スロットの分析・監視

🔐 4. セキュリティ・ガバナンス系

サービス/用語説明
Cloud IAM誰が(プリンシパル)・何に(リソース)・何を(ロール)できるかを管理
事前定義ロール / カスタムロールGoogle定義の標準ロール / 自前で権限を絞ったロール
最小権限の原則必要最小限の権限のみ付与する設計原則
組織ポリシー (Org Policy)組織全体に制約を強制(例:特定リージョンのみ許可)
VPC Service Controlsサービス境界を作りデータ持ち出しを防止
CMEK顧客管理の暗号鍵(Cloud KMSで管理)
CSEK顧客提供の暗号鍵(鍵を自分で持ち込む)
デフォルト暗号化Google管理鍵による保存時の自動暗号化
Cloud KMS暗号鍵の管理サービス
Cloud DLP (Sensitive Data Protection)PIIの検出・分類・マスキング・トークン化
PII個人を特定できる情報(氏名・住所・番号など)
ポリシータグ (Policy Tags)BigQueryの列レベルセキュリティのタグ
承認済みビュー (Authorized View)元テーブルへの権限なしで結果だけ共有するビュー
データ主権 (Data Sovereignty)データを特定の国・地域に置く法的要件

📊 5. 分析・BI・ML系

サービス/用語説明
LookerエンタープライズBIプラットフォーム(LookMLでモデル定義)
Looker Studio無料のダッシュボード/レポートツール(旧Data Studio)
BI EngineBigQueryのインメモリ高速化エンジン(BIの低レイテンシ化)
マテリアライズドビュー集計結果を事前計算・保存して高速化・低コスト化
BigQuery ML (BQML)SQLだけで機械学習モデルを作成・予測
Vertex AIGCPの統合MLプラットフォーム(学習〜サービング〜MLOps)
Feature Store特徴量の一元管理・再利用・サービング
埋め込み (Embeddings)テキスト等をベクトル化した表現。類似検索/RAGに使用
RAG検索拡張生成。外部データを検索しLLM回答を補強
Vector Searchベクトルの近傍検索(埋め込みの検索)
Analytics Hubデータセットを組織間で共有(コピー不要のデータ交換)

🚚 6. データ移行系

サービス説明使いどころ
BigQuery Data Transfer ServiceSaaS/他DWHからBigQueryへ定期転送SaaS・Teradata/Redshift等からの取り込み
Database Migration Service (DMS)DBの移行(同種/異種)Cloud SQL/AlloyDBへのDB移行
DatastreamサーバーレスCDC(継続的な変更複製)リアルタイムレプリケーション
Transfer Appliance物理アプライアンスでオフライン大容量転送数十TB〜PB級・ネットワーク転送が非現実的な場合
Storage Transfer Serviceオンライン大容量転送(他クラウド/オンプレ→GCS)S3/オンプレからGCSへの転送

🧱 7. データプラットフォーム / ガバナンス

サービス/用語説明
Dataplexデータレイク/ウェアハウスを横断する統合ガバナンス・管理
Dataplex Catalogメタデータカタログ(データの検索・発見・タグ付け)
データレイク生データ(構造化/非構造化)をそのまま貯める場所。主にGCS
データウェアハウス (DWH)分析向けに整形・統合したデータの保管(BigQuery)
データメッシュドメイン主体の分散データ所有+フェデレーテッドガバナンス
データガバナンスデータの品質・セキュリティ・コンプライアンスの管理

📚 8. 一般概念・データモデリング

用語説明
OLTPオンライントランザクション処理。更新中心(Cloud SQL/Spanner)
OLAPオンライン分析処理。集計・分析中心(BigQuery)
構造化データスキーマのある表形式データ(RDB/CSV)
半構造化データJSON/Avro/Parquetなどタグ付きデータ
非構造化データ画像・音声・テキスト・動画など
正規化 / 非正規化冗長排除 / 分析高速化のため冗長を許容(BQは非正規化が基本)
ネスト/繰り返しフィールドBigQueryのSTRUCT/ARRAY。JOIN回避に有効
パーティションテーブルを日付等で分割し、スキャン量とコストを削減
クラスタリング列の値で並べ替え、フィルタ/集計を高速化
ACID原子性・一貫性・独立性・永続性(トランザクションの保証)
結果整合性一時的に不整合を許し、最終的に整合する(Bigtable等)
スキーマオンリード / スキーマオンライト読み取り時 / 書き込み時にスキーマを適用
スター/スノーフレークスキーマDWHの次元モデリング手法
スロット (Slot)BigQueryのクエリ実行の計算単位
タイムトラベルBigQueryで過去7日間のデータを参照・復元できる機能
ephemeral クラスタジョブ実行時のみ起動し完了後に破棄するクラスタ(コスト最適)
プリエンプティブル/Spot VM低価格だが中断され得るVM(耐障害ジョブ向け)

該当する用語が見つからない場合は検索語を短くしてください。各用語の詳細は 学習資料 を参照。