📖 用語集
試験頻出用語をカテゴリ別に。🆕 は 2026/6/1 改訂版で追加・強化。
🧱 ML / MLOps 基礎
| 用語 | 説明 |
| 教師あり学習 | ラベル付きデータで訓練。分類・回帰 |
| 教師なし学習 | クラスタリング・次元削減・異常検知 |
| 強化学習 (RL) | 環境との相互作用で報酬最大化 |
| 生成 AI (gen AI) | テキスト・画像・音声・動画など新規生成 |
| 基盤モデル | 大規模事前学習モデル。Gemini / Llama / Imagen 等 |
| 過学習 | 訓練データに過剰適応、汎化性能低下 |
| データリーケージ | 未来データ等の混入で評価が過大 |
| MLOps Level 0/1/2 | 手動 / パイプライン自動化 / CI/CD/CT 完全自動化 |
| CI / CD / CT | 統合 / 配信 / Continuous Training(自動再訓練) |
| Training-Serving Skew | 訓練/推論の前処理ズレ |
| Data Drift | 入力 X の分布変化 |
| Concept Drift | P(Y|X) の関係変化(ラベル必要) |
| 🆕 Feature Attribution Drift | 特徴量寄与度の分布変化(4 つ目のドリフト) |
| Lineage | データ/モデルの由来追跡 |
📊 評価メトリクス
| 用語 | 説明 |
| Accuracy / Precision / Recall / F1 | 分類の基本指標 |
| AUC-ROC / AUC-PR | 閾値非依存。不均衡データは PR-AUC |
| RMSE / MAE / MAPE | 回帰の誤差指標 |
| BLEU / ROUGE / METEOR | 翻訳・要約の自動評価 |
| Perplexity | 言語モデルの当てはまり |
| 🆕 LLM-as-a-judge | LLM を評価者にして他モデル出力を採点 |
| 🆕 Gen AI Evaluation Service | 自動 + LLM + 人手のマネージド統合 |
| Equalized Odds / Demographic Parity | 公平性指標 |
🛠 Google Cloud ML / AI 中核サービス
| 用語 | 説明 |
| Gemini Enterprise Agent Platform | ML/AI 統合プラットフォーム(旧 Vertex AI) |
| Agent Platform AutoML | コードレス自動 ML |
| Agent Platform Workbench | マネージド Jupyter |
| Colab Enterprise | サーバーレス Colab、協業向け |
| Agent Platform Pipelines | サーバーレス KFP/TFX パイプライン |
| Agent Platform Feature Store | 訓練/推論共通の特徴量ストア(Online / Offline) |
| Agent Platform Model Registry | モデルの中央カタログ・バージョン管理 |
| Agent Platform Inference | マネージド推論サービング(旧 Endpoints/Prediction) |
| Agent Platform Model Monitoring | ドリフト/スキュー検知 |
| Agent Platform Experiments | 実験パラメータ・メトリクス記録 |
| Agent Platform ML Metadata | パイプラインの系統管理 |
| Model Garden | Google 製 + OSS 基盤モデルの統合カタログ |
| 🆕 Tabular Workflows | E2E パイプライン化された AutoML 上位互換 |
| 🆕 Ray on Agent Platform | マネージド Ray(分散 ML / RL / HPT) |
| Vizier | ベイズ最適化ベースの HPT |
| 🆕 Gen AI Evaluation Service | 生成 AI の統合評価サービス |
| 🆕 Model Armor | LLM 向けセキュリティ(プロンプトインジェクション・PII 防御) |
| Sensitive Data Protection | 旧 Cloud DLP。PII 検出・マスキング |
| Explainable AI | Sampled Shapley / Integrated Gradients / XRAI |
🌟 基盤モデル / Gemini
| 用語 | 説明 |
| Gemini Pro | 標準品質・コスト |
| Gemini Flash | 低レイテンシ・低コスト(単純タスクで第一候補) |
| Gemini Nano | オンデバイス(モバイル)向け |
| Gemini Ultra | 最大規模 |
| Imagen | 画像生成 |
| Veo | 動画生成 |
| Chirp | 多言語音声認識基盤 |
| プロンプトキャッシング | 固定プレフィックスを再利用、75% 割引 |
| コンテキストキャッシング | 明示的キャッシュ、保管時間で課金 |
| Batch API | 非同期一括処理、約 50% 割引 |
| 🆕 ML.GENERATE_TEXT | BigQuery から Gemini 呼び出し |
| 🆕 ML.GENERATE_EMBEDDING | BigQuery で embeddings 生成 |
| 🆕 REMOTE MODEL (Vertex AI Connection) | BigQuery 経由でリモートモデル / ファインチューニング |
🏋 訓練 / ファインチューニング
| 用語 | 説明 |
| Custom Training | Python フレームワーク自由で訓練ジョブ |
| Pre-built / Custom Container | 標準 or 自前 Dockerfile |
| HyperparameterTuningJob | Vizier 統合 HPT |
| Full Fine-tuning | 全パラメータ更新 |
| PEFT | Parameter-Efficient Fine-tuning |
| LoRA | Low-Rank Adaptation(PEFT 代表) |
| Prompt Tuning / Adapter | PEFT 派生手法 |
| RLHF / DPO | 人間フィードバック / 直接好み最適化 |
| Catastrophic Forgetting | 継続学習で旧タスクを忘れる |
🚀 分散訓練 / ハードウェア
| 用語 | 説明 |
| Data / Tensor / Pipeline Parallelism | 3 つの並列化戦略 |
| 3D Parallelism | data + tensor + pipeline 組合せ |
| ZeRO / FSDP | 巨大モデル向けメモリ最適化(DeepSpeed / PyTorch) |
| Reduction Server | 勾配集約専用サーバ(All-reduce 高速化) |
| TPU v5e | コスト効率重視、推論向き |
| TPU v5p | 訓練特化、超大規模 |
| 🆕 Multislice | 複数 TPU Pod を 1 ジョブで使う |
| 🆕 Pathways | 複数 TPU を単一プログラムで扱う Google 製ランタイム |
| GPU L4 | 推論向け、Ada Lovelace 世代 |
| GPU A100/H100 | 訓練向け |
| Edge TPU / Coral | エッジ推論向け低消費電力 |
| Spot VM / Preemptible | 通常の 60〜80% 安、終了リスクあり |
| Dynamic Workload Scheduler (DWS) | バッチ計算用容量確保 |
| 量子化 / 混合精度 | INT8 / FP16 / BF16 で高速化・省メモリ |
| 勾配蓄積 | 実効バッチサイズ拡大、メモリ削減 |
| Continuous Batching (vLLM) | LLM 推論で動的にリクエスト合流 |
⛓ パイプライン / オーケストレーション
| 用語 | 説明 |
| KFP (Kubeflow Pipelines) | ML パイプライン OSS 標準 |
| TFX | TF 用 E2E ML プラットフォーム |
| 🆕 Managed Service for Apache Airflow | 旧 Cloud Composer の新名称 |
| Cloud Workflows | 軽量 API オーケストレーション(YAML) |
| Cloud Build | CI/CD 自動化 |
| Artifact Registry | コンテナ・パッケージ管理 |
| Eventarc / Cloud Scheduler | イベント / cron トリガー |
| TFDV / TFMA / TFT | データ検証 / モデル評価 / 前処理共有 |
| Cloud Deploy | 環境間プロモーション |
🛡 セキュリティ / 責任ある AI
| 用語 | 説明 |
| IAM | Identity and Access Management |
| VPC Service Controls (VPC SC) | サービス境界で外部送信制御 |
| Private Service Connect (PSC) | プライベート接続 |
| CMEK / Cloud KMS | 顧客管理暗号鍵 / 鍵管理 |
| Sensitive Data Protection | 旧 DLP。PII 検出・マスキング |
| 🆕 Model Armor | LLM 向け WAF 的ガードレール |
| Safety Filters | Gemini 内蔵の安全フィルタ |
| Confidential VM / GKE | メモリ内も暗号化された TEE |
| Differential Privacy (DP) | 訓練データに数学的ノイズ |
| Federated Learning | 端末側学習、勾配のみ集約 |
| Model Card / Data Card | モデル/データの透明性ドキュメント |
📡 サービング / ロールアウト
| 用語 | 説明 |
| Online Inference / Endpoint | リアルタイム推論 |
| Batch Prediction | 大量データの一括推論 |
| DeployedModel / traffic_split | Endpoint デプロイ単位 / トラフィック比率 |
| A/B / カナリア / シャドウ / ブルー/グリーン | ロールアウト戦略 4 種 |
| Public/Private Endpoint | インターネット可 / VPC 内のみ |
| vLLM / Triton | LLM 高スループット推論サーバ |
| TFLite | エッジ向け軽量モデル形式 |
| SavedModel / TorchScript / ONNX | モデル形式 |
🗃 データ / ストレージ
| 用語 | 説明 |
| BigQuery / BigQuery ML | サーバーレス DWH / SQL で ML |
| Cloud Storage (GCS) | オブジェクトストレージ、ML データの標準 |
| Dataflow | Apache Beam(バッチ + ストリーミング) |
| Dataproc / Serverless for Spark | Spark/Hadoop マネージド |
| Pub/Sub | メッセージング |
| TFRecord / JSONL / Parquet | 主要データフォーマット |
🔁 モニタリング / 可観測性
| 用語 | 説明 |
| Cloud Monitoring / Logging / Trace / Audit Logs | 観測 4 点セット |
| SLI / SLO / Error Budget | サービスレベル管理 |
| PSI / KL Divergence / JS Divergence | 分布差の統計指標 |
| Sampled Shapley / Integrated Gradients / XRAI | Explainable AI 手法 |