PMLE 用語集 — Professional Machine Learning Engineer
試験頻出用語を カテゴリ別 に整理。"🆕" は 2026/6/1 改訂で追加・強化された論点。 暗記カードとして使用:用語 → 1 行説明 → 関連サービス・キーポイント。
🧱 ML / MLOps 基礎
| 用語 | 説明 |
|---|---|
| 教師あり学習 (Supervised Learning) | ラベル付きデータで訓練。分類・回帰 |
| 教師なし学習 (Unsupervised Learning) | ラベルなし。クラスタリング・次元削減・異常検知 |
| 強化学習 (Reinforcement Learning, RL) | 環境との相互作用で報酬最大化。ロボット制御・ゲーム AI |
| 生成 AI (Generative AI / gen AI) | テキスト・画像・音声・動画など新規コンテンツを生成 |
| 基盤モデル (Foundation Model) | 大規模事前学習モデル。Gemini / Llama / Imagen 等 |
| 過学習 (Overfitting) | 訓練データに過剰適応、汎化性能低下 |
| 正則化 (Regularization) | L1/L2/Dropout 等で過学習を抑制 |
| 早期停止 (Early Stopping) | 検証 loss 悪化で訓練停止 |
| 交差検証 (Cross Validation) | データを分割して評価の信頼性を上げる |
| データリーケージ (Data Leakage) | 訓練に未来のデータ等が混入、評価が過大 |
| MLOps | ML のシステム開発・運用一体の方法論 |
| MLOps Level 0/1/2 | 手動 / パイプライン自動化 / CI/CD/CT 完全自動化 |
| CI (Continuous Integration) | コード変更で自動テスト・ビルド |
| CD (Continuous Delivery/Deployment) | 本番への自動配信 |
| CT (Continuous Training) | データ変化に応じた自動再訓練 |
| Training-Serving Skew | 訓練/推論の前処理ズレ |
| Data Drift | 入力 X の分布変化 |
| Concept Drift | P(Y|X) の変化 |
| 🆕 Feature Attribution Drift | 特徴量寄与度の分布変化 |
| Lineage(系統) | データ/モデルの由来追跡 |
📊 評価メトリクス
| 用語 | 説明 |
|---|---|
| Accuracy | 全正解率 |
| Precision | 陽性予測のうち真陽性 |
| Recall | 真の陽性のうち検知 |
| F1 | Precision/Recall 調和平均 |
| AUC-ROC | 閾値非依存のスコア |
| AUC-PR | 不均衡データで AUC より有用 |
| Confusion Matrix | 予測 vs 真値の表 |
| RMSE / MAE / MAPE | 回帰の誤差指標 |
| BLEU / ROUGE / METEOR | 翻訳・要約の自動評価 |
| Perplexity | 言語モデルの当てはまり |
| 🆕 LLM-as-a-judge | LLM を評価者にして他モデル出力を採点 |
| 🆕 Gen AI Evaluation Service | 自動 + LLM-judge + 人手評価のマネージド統合 |
| Equalized Odds | 公平性指標:属性間 FPR/FNR が等しい |
| Demographic Parity | 公平性指標:属性間で陽性予測率が等しい |
🛠 Google Cloud — ML / AI 中核サービス(旧 Vertex AI = 新 Agent Platform)
| 用語 | 説明 |
|---|---|
| Gemini Enterprise Agent Platform | ML/AI 統合プラットフォーム(旧 Vertex AI) |
| Agent Platform AutoML | コードレス自動 ML(旧 Vertex AI AutoML) |
| Agent Platform Workbench | マネージド Jupyter(旧 Vertex AI Workbench) |
| Colab Enterprise | サーバーレス Colab、協業向け |
| Agent Platform Pipelines | サーバーレス KFP/TFX パイプライン |
| Agent Platform Feature Store | 訓練/推論共通の特徴量ストア |
| Agent Platform Model Registry | モデルの中央カタログ・バージョン管理 |
| Agent Platform Inference | マネージド推論サービング(旧 Endpoints/Prediction) |
| Agent Platform Model Monitoring | ドリフト/スキュー検知 |
| Agent Platform Experiments | 実験パラメータ・メトリクス・成果物の記録 |
| Agent Platform ML Metadata | パイプラインの系統管理 |
| Model Garden | Google 製 + OSS 基盤モデルの統合カタログ |
| 🆕 Tabular Workflows | E2E パイプライン化された AutoML 上位互換 |
| 🆕 Ray on Agent Platform | マネージド Ray クラスタ(分散 ML / RL / HPT) |
| Vizier | ベイズ最適化ベースの HPT |
| 🆕 Gen AI Evaluation Service | 生成 AI の統合評価サービス |
| 🆕 Model Armor | LLM 向けセキュリティ(プロンプトインジェクション・PII・ジェイルブレイク防御) |
| Sensitive Data Protection | 旧 Cloud DLP。PII 検出・マスキング |
| Explainable AI | Sampled Shapley / Integrated Gradients / XRAI |
| Tabular Workflows | E2E AutoML パイプライン |
🌟 基盤モデル / Gemini
| 用語 | 説明 |
|---|---|
| Gemini Pro | 標準品質・コスト |
| Gemini Flash | 低レイテンシ・低コスト |
| Gemini Nano | オンデバイス(モバイル)向け |
| Gemini Ultra | 最大規模 |
| Imagen | 画像生成 |
| Veo | 動画生成 |
| Chirp | 多言語音声認識基盤 |
| Codey | コード生成(Gemini に統合中) |
| プロンプトキャッシング | 固定プレフィックスを再利用、75% 割引 |
| コンテキストキャッシング | 明示的キャッシュ、保管時間で課金 |
| Batch API | 非同期一括処理、約 50% 割引 |
| 🆕 ML.GENERATE_TEXT | BigQuery から Gemini 呼び出し |
| 🆕 ML.GENERATE_EMBEDDING | BigQuery で embeddings 生成 |
| 🆕 REMOTE MODEL | BigQuery → Vertex AI Connection 経由でリモートモデル |
🏋 訓練 / ファインチューニング
| 用語 | 説明 |
|---|---|
| Custom Training | Python フレームワーク自由で訓練ジョブ |
| Pre-built Container | TF/PyTorch/sklearn/XGBoost 標準環境 |
| Custom Container | 自前 Dockerfile |
| Hyperparameter Tuning Job | Vizier + Custom Training |
| Fine-tuning | 事前学習モデルを自社データで再学習 |
| Full Fine-tuning | 全パラメータ更新 |
| PEFT (Parameter-Efficient FT) | 小数パラメータのみ更新 |
| LoRA (Low-Rank Adaptation) | 低ランク行列追加学習(PEFT 代表) |
| Adapter | 中間層に小モジュール挿入 |
| Prompt Tuning | プロンプト埋め込みのみ学習 |
| RLHF | 人間フィードバック強化学習 |
| DPO | RLHF の代替(Direct Preference Optimization) |
| Catastrophic Forgetting | 継続学習で旧タスクを忘れる |
🚀 分散訓練 / ハードウェア
| 用語 | 説明 |
|---|---|
| Data Parallelism | 同モデル × 異なるデータ |
| Tensor Parallelism (Model Parallelism) | モデル内テンソル分割 |
| Pipeline Parallelism | モデル層分割 |
| 3D Parallelism | data + tensor + pipeline 組合せ |
| ZeRO (DeepSpeed) | Optimizer state/勾配/パラメータを分散保持 |
| FSDP (Fully Sharded Data Parallel) | PyTorch のシャーディング戦略 |
| NCCL | GPU 間通信ライブラリ |
| Reduction Server | 勾配集約を専用サーバで高速化 |
| TPU v5e | コスト効率重視、推論向き |
| TPU v5p | 訓練特化、超大規模 |
| 🆕 Multislice | 複数 TPU Pod を1ジョブで使う |
| 🆕 Pathways | 複数 TPU を単一プログラムで扱う Google 製ランタイム |
| GPU L4 | 推論向け、Ada Lovelace 世代 |
| GPU A100/H100 | 訓練向け |
| Edge TPU / Coral | エッジ推論向け低消費電力 |
| Spot VM / Preemptible | 通常の 60〜80% 安、終了リスクあり |
| Dynamic Workload Scheduler (DWS) | バッチ計算用容量確保 |
| 量子化 (Quantization) | INT8/FP16/BF16 でサイズ削減・高速化 |
| 混合精度 (Mixed Precision) | FP16/BF16 で高速化 |
| loss scaling | FP16 の overflow 防止 |
| 勾配蓄積 (Gradient Accumulation) | 実効バッチサイズ拡大、メモリ削減 |
| Continuous Batching (vLLM) | LLM 推論で動的にリクエスト合流 |
⛓ パイプライン / オーケストレーション
| 用語 | 説明 |
|---|---|
| KFP (Kubeflow Pipelines) | ML パイプライン OSS 標準 |
| TFX (TensorFlow Extended) | TF 用 E2E ML プラットフォーム |
| 🆕 Managed Service for Apache Airflow | 旧 Cloud Composer の新名称 |
| Cloud Workflows | 軽量 API オーケストレーション(YAML) |
| Cloud Build | CI/CD 自動化 |
| Artifact Registry | コンテナ・パッケージ管理 |
| Cloud Source Repositories / GitHub | コード管理 |
| Eventarc | イベントベースのトリガー |
| Cloud Scheduler | cron スケジューラ |
| TFDV (TF Data Validation) | スキーマ + 統計でデータ検証 |
| TFMA (TF Model Analysis) | モデル評価・スライス分析 |
| TFT (TensorFlow Transform) | 訓練/推論で共通の前処理 graph |
| Cloud Deploy | 環境 (dev/stg/prod) のプロモーション |
🛡 セキュリティ / 責任ある AI
| 用語 | 説明 |
|---|---|
| IAM | Identity and Access Management |
| VPC Service Controls (VPC SC) | サービス境界で外部送信制御 |
| Private Service Connect (PSC) | プライベート接続 |
| CMEK (Customer-Managed Encryption Keys) | 顧客管理暗号鍵 |
| Cloud KMS | 鍵管理サービス |
| Sensitive Data Protection (旧 DLP) | PII 検出・マスキング |
| 🆕 Model Armor | LLM 向け WAF 的ガードレール |
| Safety Filters | Gemini 内蔵の安全フィルタ |
| Confidential VM / GKE Nodes | メモリ内も暗号化された TEE |
| Differential Privacy (DP) | 訓練データに数学的ノイズ |
| Federated Learning | 端末側学習、勾配のみ集約 |
| Model Card | モデルの目的・性能・限界の文書 |
| Data Card | データセットの由来・偏りの文書 |
| Equalized Odds | 公平性指標 |
| Demographic Parity | 公平性指標 |
| Bias / Fairness | 偏り / 公平性 |
📡 サービング / ロールアウト
| 用語 | 説明 |
|---|---|
| Online Inference / Endpoint | リアルタイム推論 |
| Batch Prediction | 大量データの一括推論 |
| DeployedModel | Endpoint にデプロイされたモデル |
| traffic_split | 複数モデル間のトラフィック比率 |
| A/B テスト | 2 モデル同時比較 |
| カナリアデプロイ | 段階拡大ロールアウト |
| シャドウデプロイ | 本番影響なしの並行検証 |
| ブルー/グリーン | 新旧並列、ルーティング切替 |
| ローリング | 漸進置換 |
| Public/Private Endpoint | インターネット可 / VPC 内のみ |
| vLLM / Triton | LLM 高スループット推論サーバ |
| TF Serving / TorchServe | フレームワーク標準推論サーバ |
| TFLite | エッジ向け軽量モデル形式 |
| SavedModel | TF モデル標準形式 |
| TorchScript | PyTorch モデル形式 |
| ONNX | フレームワーク間相互運用 |
🗃 データ / ストレージ
| 用語 | 説明 |
|---|---|
| BigQuery | サーバーレス DWH |
| BigQuery ML | SQL で ML |
| BigLake / BigQuery Omni | マルチクラウド分析 |
| Cloud Storage (GCS) | オブジェクトストレージ、ML データの標準 |
| Cloud SQL | マネージド RDB(MySQL/PostgreSQL) |
| Spanner | グローバル分散 RDB |
| AlloyDB | PostgreSQL 互換、高性能 |
| Bigtable | NoSQL ワイドカラム |
| Firestore | NoSQL ドキュメント |
| Memorystore | Redis/Memcached マネージド |
| Dataflow | Apache Beam(バッチ + ストリーミング) |
| Dataproc | Spark/Hadoop マネージド |
| Dataproc Serverless for Spark | サーバーレス Spark |
| Cloud Data Fusion | GUI ETL |
| Pub/Sub | メッセージング |
| Datastream | CDC ストリーミング |
| TFRecord | TF 用シリアライズフォーマット |
| JSONL (JSON Lines) | LLM 訓練データ標準 |
| Parquet | 列指向データ |
🔁 モニタリング / 可観測性
| 用語 | 説明 |
|---|---|
| Cloud Monitoring | メトリクス可視化・アラート |
| Cloud Logging | ログ集約 |
| Cloud Trace | 分散トレース |
| Cloud Audit Logs | 監査ログ |
| SLI / SLO / Error Budget | サービスレベル管理 |
| Model Monitoring | ML 専用の継続的観測 |
| PSI / KL / JS Divergence | 分布差の統計指標 |
| Sampled Shapley | Explainable AI(表形式) |
| Integrated Gradients | Explainable AI(DNN/画像/テキスト) |
| XRAI | Explainable AI(画像リージョン) |
用語集は最新ガイドの新規論点(🆕)を中心に押さえ、未知の用語は
02_学習資料/の該当箇所へジャンプして確認。