用語集

用語集 — Professional Data Engineer

PDE頻出のサービス・概念をカテゴリ別にまとめたリファレンスです。 試験は日本語受験可ですが、選択肢やサービス名は英語ベース。日英対応を意識して暗記してください。

使い方:学習の合間に通読 → 8割わからない場合は該当の学習資料へ。試験直前の総ざらいにも。


🗂️ 1. ストレージ系サービス

サービス 種別 説明 主な使いどころ
BigQuery DWH (OLAP) サーバーレスなデータウェアハウス。ペタバイト級の分析クエリを高速実行 大規模分析・BI・ML(BQML)
Cloud Storage (GCS) オブジェクトストレージ 非構造化データの保存。Standard/Nearline/Coldline/Archiveのクラス データレイク・バックアップ・ステージング
Cloud SQL RDB (OLTP) マネージドなMySQL/PostgreSQL/SQL Server。リージョナル 中小規模のトランザクション、Webアプリ
AlloyDB RDB (OLTP/HTAP) PostgreSQL互換の高性能DB。分析も速い PostgreSQL互換で高負荷・分析併用
Spanner 分散RDB グローバル分散・水平スケール・強整合性のRDB。TrueTime使用 グローバル規模・無停止・強整合が必要なOLTP
Bigtable NoSQL (ワイドカラム) 低レイテンシ・高スループットのKVS。HBase API互換 時系列・IoT・大量書き込み、ミリ秒応答
Firestore NoSQL (ドキュメント) スケーラブルなドキュメントDB。モバイル/Web向け同期 モバイルアプリ・リアルタイム同期
Memorystore インメモリ マネージドRedis/Memcached キャッシュ・セッション・低レイテンシ
BigLake ストレージエンジン GCS/他クラウド上のデータをBigQueryから統一的に扱う データレイク統合・マルチクラウド分析

意思決定の軸:①OLTP(更新中心)か OLAP(分析中心)か → ②構造化の度合い → ③スケール規模 → ④整合性要件(強整合/結果整合)


⚙️ 2. データ処理・パイプライン系

サービス/用語 説明 使いどころ
Dataflow Apache Beamベースのサーバーレスなバッチ/ストリーミング処理 ストリーミング・統一パイプライン・自動スケール
Apache Beam バッチ/ストリーミングを統一するプログラミングモデル Dataflowの実体。PCollection/PTransform
Dataproc マネージドなSpark/Hadoopクラスタ 既存Spark/Hadoop資産の移行、ephemeralクラスタ
Cloud Data Fusion GUIベースのETL/ELTツール(CDAPベース) ノーコード/ローコードでパイプライン構築
Dataform BigQuery内のELT・SQL変換をバージョン管理 BQ内のデータ変換・依存管理・テスト
Pub/Sub グローバルなメッセージング(pub-subモデル) ストリーミングの取り込み・イベント連携
Pub/Sub Lite ゾーン単位の低コスト版Pub/Sub コスト優先・高スループットの取り込み
Apache Kafka 分散ストリーミングプラットフォーム(OSS) 既存Kafka資産(Managed Service for Kafka)
Datastream サーバーレスなCDC(変更データキャプチャ) DBの変更をリアルタイムにBQ/GCSへ複製

処理パターン用語

用語 説明
バッチ処理 蓄積したデータをまとめて処理。スループット重視
ストリーミング処理 データ到着ごとにリアルタイム処理。レイテンシ重視
ウィンドウ (Windowing) ストリームを時間で区切る単位。固定/スライディング/セッション
ウォーターマーク (Watermark) 「この時刻までのデータは到着した」と見なす境界
遅延到着データ (Late data) ウォーターマーク後に届くデータ。トリガー/許容遅延で制御
トリガー (Trigger) ウィンドウの結果をいつ出力するかの制御
Exactly-once 各レコードを重複なく正確に1回処理する保証
Dataflow Shuffle シャッフル処理をサービス側で実行しVM負荷を下げる

🔀 3. オーケストレーション・運用系

サービス/用語 説明 使いどころ
Cloud Composer マネージドApache Airflow。DAGでワークフロー管理 複雑な依存関係のあるジョブ群
Workflows サーバーレスなAPIオーケストレーション(YAML/JSON) 軽量なサービス連携・HTTP/APIの順次実行
Cloud Scheduler cronベースのジョブスケジューラ 定期実行のトリガー
DAG 有向非巡回グラフ。タスクの依存関係を表現(Airflow) Composerのワークフロー定義
Cloud Build CI/CDのビルド・テスト・デプロイ自動化 パイプラインのCI/CD
Cloud Monitoring メトリクス監視・アラート・ダッシュボード 可観測性(メトリクス)
Cloud Logging ログの収集・検索・分析 可観測性(ログ)
INFORMATION_SCHEMA BigQueryのメタデータビュー(ジョブ/使用量等) クエリ/スロットの分析・監視

🔐 4. セキュリティ・ガバナンス系

サービス/用語 説明
Cloud IAM 誰が(プリンシパル)・何に(リソース)・何を(ロール)できるかを管理
事前定義ロール / カスタムロール Google定義の標準ロール / 自前で権限を絞ったロール
最小権限の原則 必要最小限の権限のみ付与する設計原則
組織ポリシー (Org Policy) 組織全体に制約を強制(例:特定リージョンのみ許可)
VPC Service Controls サービス境界を作りデータ持ち出しを防止
CMEK 顧客管理の暗号鍵(Cloud KMSで管理)
CSEK 顧客提供の暗号鍵(鍵を自分で持ち込む)
デフォルト暗号化 Google管理鍵による保存時の自動暗号化
Cloud KMS 暗号鍵の管理サービス
Cloud DLP (Sensitive Data Protection) PIIの検出・分類・マスキング・トークン化
PII 個人を特定できる情報(氏名・住所・番号など)
ポリシータグ (Policy Tags) BigQueryの列レベルセキュリティのタグ
承認済みビュー (Authorized View) 元テーブルへの権限なしで結果だけ共有するビュー
データ主権 (Data Sovereignty) データを特定の国・地域に置く法的要件

📊 5. 分析・BI・ML系

サービス/用語 説明
Looker エンタープライズBIプラットフォーム(LookMLでモデル定義)
Looker Studio 無料のダッシュボード/レポートツール(旧Data Studio)
BI Engine BigQueryのインメモリ高速化エンジン(BIの低レイテンシ化)
マテリアライズドビュー 集計結果を事前計算・保存して高速化・低コスト化
BigQuery ML (BQML) SQLだけで機械学習モデルを作成・予測
Vertex AI GCPの統合MLプラットフォーム(学習〜サービング〜MLOps)
Feature Store 特徴量の一元管理・再利用・サービング
埋め込み (Embeddings) テキスト等をベクトル化した表現。類似検索/RAGに使用
RAG 検索拡張生成。外部データを検索しLLM回答を補強
Vector Search ベクトルの近傍検索(埋め込みの検索)
Analytics Hub データセットを組織間で共有(コピー不要のデータ交換)

🚚 6. データ移行系

サービス 説明 使いどころ
BigQuery Data Transfer Service SaaS/他DWHからBigQueryへ定期転送 SaaS・Teradata/Redshift等からの取り込み
Database Migration Service (DMS) DBの移行(同種/異種) Cloud SQL/AlloyDBへのDB移行
Datastream サーバーレスCDC(継続的な変更複製) リアルタイムレプリケーション
Transfer Appliance 物理アプライアンスでオフライン大容量転送 数十TB〜PB級・ネットワーク転送が非現実的な場合
Storage Transfer Service オンライン大容量転送(他クラウド/オンプレ→GCS) S3/オンプレからGCSへの転送

🧱 7. データプラットフォーム / ガバナンス

サービス/用語 説明
Dataplex データレイク/ウェアハウスを横断する統合ガバナンス・管理
Dataplex Catalog メタデータカタログ(データの検索・発見・タグ付け)
データレイク 生データ(構造化/非構造化)をそのまま貯める場所。主にGCS
データウェアハウス (DWH) 分析向けに整形・統合したデータの保管(BigQuery)
データメッシュ ドメイン主体の分散データ所有+フェデレーテッドガバナンス
データガバナンス データの品質・セキュリティ・コンプライアンスの管理

📚 8. 一般概念・データモデリング

用語 説明
OLTP オンライントランザクション処理。更新中心(Cloud SQL/Spanner)
OLAP オンライン分析処理。集計・分析中心(BigQuery)
構造化データ スキーマのある表形式データ(RDB/CSV)
半構造化データ JSON/Avro/Parquetなどタグ付きデータ
非構造化データ 画像・音声・テキスト・動画など
正規化 / 非正規化 冗長排除 / 分析高速化のため冗長を許容(BQは非正規化が基本)
ネスト/繰り返しフィールド BigQueryのSTRUCT/ARRAY。JOIN回避に有効
パーティション テーブルを日付等で分割し、スキャン量とコストを削減
クラスタリング 列の値で並べ替え、フィルタ/集計を高速化
ACID 原子性・一貫性・独立性・永続性(トランザクションの保証)
結果整合性 一時的に不整合を許し、最終的に整合する(Bigtable等)
スキーマオンリード / スキーマオンライト 読み取り時 / 書き込み時にスキーマを適用
スター/スノーフレークスキーマ DWHの次元モデリング手法
スロット (Slot) BigQueryのクエリ実行の計算単位
タイムトラベル BigQueryで過去7日間のデータを参照・復元できる機能
ephemeral クラスタ ジョブ実行時のみ起動し完了後に破棄するクラスタ(コスト最適)
プリエンプティブル/Spot VM 低価格だが中断され得るVM(耐障害ジョブ向け)

🧠 暗記のコツ