用語集
PDE頻出のサービス・概念をカテゴリ別にまとめたリファレンス。試験は日本語受験可ですが、選択肢やサービス名は英語ベース。日英対応を意識して暗記しましょう。
💡 暗記のコツサービスは「役割の動詞」で覚える(BigQuery=分析する/Pub/Sub=受け取る/Dataflow=処理する/Composer=束ねる)。似たサービスはペアで対比(Dataflow⇔Dataproc、Composer⇔Workflows、Spanner⇔Bigtable、CMEK⇔CSEK、DMS⇔Datastream)。
🗂️ 1. ストレージ系サービス
| サービス | 種別 | 説明 | 主な使いどころ |
| BigQuery | DWH (OLAP) | サーバーレスなデータウェアハウス。ペタバイト級の分析クエリを高速実行 | 大規模分析・BI・ML(BQML) |
| Cloud Storage (GCS) | オブジェクトストレージ | 非構造化データの保存。Standard/Nearline/Coldline/Archiveのクラス | データレイク・バックアップ・ステージング |
| Cloud SQL | RDB (OLTP) | マネージドなMySQL/PostgreSQL/SQL Server。リージョナル | 中小規模のトランザクション、Webアプリ |
| AlloyDB | RDB (OLTP/HTAP) | PostgreSQL互換の高性能DB。分析も速い | PostgreSQL互換で高負荷・分析併用 |
| Spanner | 分散RDB | グローバル分散・水平スケール・強整合のRDB。TrueTime使用 | グローバル規模・無停止・強整合が必要なOLTP |
| Bigtable | NoSQL (ワイドカラム) | 低レイテンシ・高スループットのKVS。HBase API互換 | 時系列・IoT・大量書き込み、ミリ秒応答 |
| Firestore | NoSQL (ドキュメント) | スケーラブルなドキュメントDB。モバイル/Web向け同期 | モバイルアプリ・リアルタイム同期 |
| Memorystore | インメモリ | マネージドRedis/Memcached | キャッシュ・セッション・低レイテンシ |
| BigLake | ストレージエンジン | GCS/他クラウド上のデータをBigQueryから統一的に扱う | データレイク統合・マルチクラウド分析 |
⚙️ 2. データ処理・パイプライン系
| サービス/用語 | 説明 | 使いどころ |
| Dataflow | Apache Beamベースのサーバーレスなバッチ/ストリーミング処理 | ストリーミング・統一パイプライン・自動スケール |
| Apache Beam | バッチ/ストリーミングを統一するプログラミングモデル | Dataflowの実体。PCollection/PTransform |
| Dataproc | マネージドなSpark/Hadoopクラスタ | 既存Spark/Hadoop資産の移行、ephemeralクラスタ |
| Cloud Data Fusion | GUIベースのETL/ELTツール(CDAPベース) | ノーコード/ローコードでパイプライン構築 |
| Dataform | BigQuery内のELT・SQL変換をバージョン管理 | BQ内のデータ変換・依存管理・テスト |
| Pub/Sub | グローバルなメッセージング(pub-subモデル) | ストリーミングの取り込み・イベント連携 |
| Pub/Sub Lite | ゾーン単位の低コスト版Pub/Sub | コスト優先・高スループットの取り込み |
| Apache Kafka | 分散ストリーミングプラットフォーム(OSS) | 既存Kafka資産(Managed Service for Kafka) |
| Datastream | サーバーレスなCDC(変更データキャプチャ) | DBの変更をリアルタイムにBQ/GCSへ複製 |
| バッチ処理 | 蓄積したデータをまとめて処理。スループット重視 | 日次集計・大量変換 |
| ストリーミング処理 | データ到着ごとにリアルタイム処理。レイテンシ重視 | リアルタイム分析・異常検知 |
| ウィンドウ (Windowing) | ストリームを時間で区切る単位。固定/スライディング/セッション | ストリーミング集計 |
| ウォーターマーク (Watermark) | 「この時刻までのデータは到着した」と見なす境界 | 遅延データの判定 |
| 遅延到着データ (Late data) | ウォーターマーク後に届くデータ。トリガー/許容遅延で制御 | ストリーミングの正確性 |
| トリガー (Trigger) | ウィンドウの結果をいつ出力するかの制御 | 早期/遅延発火 |
| Exactly-once | 各レコードを重複なく正確に1回処理する保証 | Dataflowの処理保証 |
| Dataflow Shuffle | シャッフル処理をサービス側で実行しVM負荷を下げる | バッチの効率化 |
🔀 3. オーケストレーション・運用系
| サービス/用語 | 説明 | 使いどころ |
| Cloud Composer | マネージドApache Airflow。DAGでワークフロー管理 | 複雑な依存関係のあるジョブ群 |
| Workflows | サーバーレスなAPIオーケストレーション(YAML/JSON) | 軽量なサービス連携・HTTP/APIの順次実行 |
| Cloud Scheduler | cronベースのジョブスケジューラ | 定期実行のトリガー |
| DAG | 有向非巡回グラフ。タスクの依存関係を表現(Airflow) | Composerのワークフロー定義 |
| Cloud Build | CI/CDのビルド・テスト・デプロイ自動化 | パイプラインのCI/CD |
| Cloud Monitoring | メトリクス監視・アラート・ダッシュボード | 可観測性(メトリクス) |
| Cloud Logging | ログの収集・検索・分析 | 可観測性(ログ) |
| INFORMATION_SCHEMA | BigQueryのメタデータビュー(ジョブ/使用量等) | クエリ/スロットの分析・監視 |
🔐 4. セキュリティ・ガバナンス系
| サービス/用語 | 説明 |
| Cloud IAM | 誰が(プリンシパル)・何に(リソース)・何を(ロール)できるかを管理 |
| 事前定義ロール / カスタムロール | Google定義の標準ロール / 自前で権限を絞ったロール |
| 最小権限の原則 | 必要最小限の権限のみ付与する設計原則 |
| 組織ポリシー (Org Policy) | 組織全体に制約を強制(例:特定リージョンのみ許可) |
| VPC Service Controls | サービス境界を作りデータ持ち出しを防止 |
| CMEK | 顧客管理の暗号鍵(Cloud KMSで管理) |
| CSEK | 顧客提供の暗号鍵(鍵を自分で持ち込む) |
| デフォルト暗号化 | Google管理鍵による保存時の自動暗号化 |
| Cloud KMS | 暗号鍵の管理サービス |
| Cloud DLP (Sensitive Data Protection) | PIIの検出・分類・マスキング・トークン化 |
| PII | 個人を特定できる情報(氏名・住所・番号など) |
| ポリシータグ (Policy Tags) | BigQueryの列レベルセキュリティのタグ |
| 承認済みビュー (Authorized View) | 元テーブルへの権限なしで結果だけ共有するビュー |
| データ主権 (Data Sovereignty) | データを特定の国・地域に置く法的要件 |
📊 5. 分析・BI・ML系
| サービス/用語 | 説明 |
| Looker | エンタープライズBIプラットフォーム(LookMLでモデル定義) |
| Looker Studio | 無料のダッシュボード/レポートツール(旧Data Studio) |
| BI Engine | BigQueryのインメモリ高速化エンジン(BIの低レイテンシ化) |
| マテリアライズドビュー | 集計結果を事前計算・保存して高速化・低コスト化 |
| BigQuery ML (BQML) | SQLだけで機械学習モデルを作成・予測 |
| Vertex AI | GCPの統合MLプラットフォーム(学習〜サービング〜MLOps) |
| Feature Store | 特徴量の一元管理・再利用・サービング |
| 埋め込み (Embeddings) | テキスト等をベクトル化した表現。類似検索/RAGに使用 |
| RAG | 検索拡張生成。外部データを検索しLLM回答を補強 |
| Vector Search | ベクトルの近傍検索(埋め込みの検索) |
| Analytics Hub | データセットを組織間で共有(コピー不要のデータ交換) |
🚚 6. データ移行系
| サービス | 説明 | 使いどころ |
| BigQuery Data Transfer Service | SaaS/他DWHからBigQueryへ定期転送 | SaaS・Teradata/Redshift等からの取り込み |
| Database Migration Service (DMS) | DBの移行(同種/異種) | Cloud SQL/AlloyDBへのDB移行 |
| Datastream | サーバーレスCDC(継続的な変更複製) | リアルタイムレプリケーション |
| Transfer Appliance | 物理アプライアンスでオフライン大容量転送 | 数十TB〜PB級・ネットワーク転送が非現実的な場合 |
| Storage Transfer Service | オンライン大容量転送(他クラウド/オンプレ→GCS) | S3/オンプレからGCSへの転送 |
🧱 7. データプラットフォーム / ガバナンス
| サービス/用語 | 説明 |
| Dataplex | データレイク/ウェアハウスを横断する統合ガバナンス・管理 |
| Dataplex Catalog | メタデータカタログ(データの検索・発見・タグ付け) |
| データレイク | 生データ(構造化/非構造化)をそのまま貯める場所。主にGCS |
| データウェアハウス (DWH) | 分析向けに整形・統合したデータの保管(BigQuery) |
| データメッシュ | ドメイン主体の分散データ所有+フェデレーテッドガバナンス |
| データガバナンス | データの品質・セキュリティ・コンプライアンスの管理 |
📚 8. 一般概念・データモデリング
| 用語 | 説明 |
| OLTP | オンライントランザクション処理。更新中心(Cloud SQL/Spanner) |
| OLAP | オンライン分析処理。集計・分析中心(BigQuery) |
| 構造化データ | スキーマのある表形式データ(RDB/CSV) |
| 半構造化データ | JSON/Avro/Parquetなどタグ付きデータ |
| 非構造化データ | 画像・音声・テキスト・動画など |
| 正規化 / 非正規化 | 冗長排除 / 分析高速化のため冗長を許容(BQは非正規化が基本) |
| ネスト/繰り返しフィールド | BigQueryのSTRUCT/ARRAY。JOIN回避に有効 |
| パーティション | テーブルを日付等で分割し、スキャン量とコストを削減 |
| クラスタリング | 列の値で並べ替え、フィルタ/集計を高速化 |
| ACID | 原子性・一貫性・独立性・永続性(トランザクションの保証) |
| 結果整合性 | 一時的に不整合を許し、最終的に整合する(Bigtable等) |
| スキーマオンリード / スキーマオンライト | 読み取り時 / 書き込み時にスキーマを適用 |
| スター/スノーフレークスキーマ | DWHの次元モデリング手法 |
| スロット (Slot) | BigQueryのクエリ実行の計算単位 |
| タイムトラベル | BigQueryで過去7日間のデータを参照・復元できる機能 |
| ephemeral クラスタ | ジョブ実行時のみ起動し完了後に破棄するクラスタ(コスト最適) |
| プリエンプティブル/Spot VM | 低価格だが中断され得るVM(耐障害ジョブ向け) |
該当する用語が見つからない場合は検索語を短くしてください。各用語の詳細は 学習資料 を参照。