シラバス詳細

シラバス詳細 — Professional Machine Learning Engineer

公式試験ガイド(2026年6月1日改訂版)の全範囲を日本語化し、各項目に 「何が問われるか」「キーサービス」 を補足したものです。 学習前にここで地図を頭に入れ、各論は 02_学習資料/ で深掘りしてください。

凡例:🔑 = 頻出キーサービス/⚠️ = ひっかけ・判断ポイント/🆕 = 改訂で追加・強化された論点


📊 セクション別出題比重(一覧)

# セクション 比重 学習優先度
3 プロトタイプから ML モデルへのスケール ~21% ⭐⭐⭐⭐⭐
4 モデルのサービングとスケール ~20% ⭐⭐⭐⭐⭐
5 ML パイプラインの自動化とオーケストレーション ~18% ⭐⭐⭐⭐
2 チーム横断でのデータとモデルの管理 ~16% ⭐⭐⭐⭐
1 ローコード AI ソリューションの設計 ~13% ⭐⭐⭐
6 AI ソリューションのモニタリング ~13% ⭐⭐⭐

戦略:MLOps 中核のセクション 3 + 4 + 5 で約 59% を占める。ここを確実に取りに行く。生成 AI と Agent Platform 関連(旧 Vertex AI)の機能名・サービス名は新ガイドで頻出になったので、用語と使い分けを丸暗記レベルで押さえる。


🧩 セクション1:ローコード AI ソリューションの設計(~13%)

Code を書かずに AI を構築する手段(AutoML / 基盤モデル / API)の使い分け。

1.1 BigQuery ML または AutoML on Agent Platform を用いた ML モデルの開発

🔑 BigQuery ML / Agent Platform AutoML (Tabular / Image / Text / Video) ⚠️ "コードを書かずに" "データはすでに BigQuery にある" → BigQuery ML が第一候補。AutoML はマルチモーダルや画像/動画系で強い

1.2 Google Cloud AI API または基盤モデルを用いた AI ソリューションの構築

🔑 Document AI / Vision API / Translate API / Speech-to-Text / Natural Language API / Gemini / Imagen / Veo / Model Garden ⚠️ "OCRと請求書抽出" → Document AI、"画像分類だが既製モデルで十分" → Vision API、"独自データで翻訳精度を上げたい" → Translation Custom Model ⚠️ Gemini コスト最適化:プロンプトキャッシング・コンテキストキャッシング・Batch API・モデルサイズの選定(Flash vs Pro)・推論場所(リージョン)


🤝 セクション2:チーム横断でのデータとモデルの管理(~16%)

データ探索・前処理・ノートブック協業・実験管理。MLOps の入口。

2.1 ML 向けデータの探索と前処理

🔑 BigQuery / Dataflow / Dataproc (Spark) / pandas / Cloud DLP / Agent Platform Feature Store ⚠️ "TB級・SQLで完結" → BigQuery、"スケールアウトしたいストリーミング/バッチ ETL" → Dataflow、"既存 Spark 資産あり" → Dataproc、"GB級でローカルで足りる" → pandas/Polars ⚠️ PII:Cloud DLP でトークン化/マスキング、列レベルポリシータグ

2.2 ノートブックを使ったモデルのプロトタイピング

🔑 Agent Platform Workbench / Colab Enterprise / Model Garden / PyTorch / JAX / scikit-learn ⚠️ Workbench はインスタンス管理が必要、Colab Enterprise はサーバーレスでより手軽 ⚠️ ノートブックのセキュリティ:VPC SC 内に配置、Customer-Managed Encryption Keys (CMEK)、サービスアカウントの最小権限

2.3 ML 実験のトラッキングと実行

🔑 Agent Platform Experiments / Agent Platform Pipelines / Kubeflow Pipelines / Agent Platform ML Metadata ⚠️ LLM-as-a-judge:人手評価が難しい長文生成の品質評価で使用。Geminiを評価者にして他モデル出力をスコアリング ⚠️ Pipelines は KFP (Kubeflow Pipelines) と互換。Agent Platform Pipelines はサーバーレスで運用


🚀 セクション3:プロトタイプから ML モデルへのスケール(~21%)★最重要

モデル選定・訓練・分散・ハードウェア。試験で最も比重が大きい。

3.1 タスクに応じたモデル構築(コスト・複雑性・レイテンシ・スケーラビリティ)

🔑 ARIMA(時系列) / DNN / LLM / Boosted Trees / Linear / Logistic ⚠️ 解釈性が高いものから順に: 線形/ロジ → 決定木 → Boosted Trees → DNN → LLM。"なぜそう予測したか" が必須なら線形寄り or Explainable AI で属性を付与 ⚠️ 構造化データの分類/回帰 + 解釈性 → BigQuery ML or AutoML Tabular、画像分類 → AutoML Image or カスタム CNN、テキスト要約 → Gemini ファインチューニング

3.2 モデルの訓練

🔑 Agent Platform Custom Training / Kubeflow / Agent Platform AutoML / Tabular Workflows / Vizier (HPT) ⚠️ ファインチューニングを検討するタイミング: プロンプト/few-shot で精度が頭打ち、ドメイン固有の用語/形式、推論コスト削減(小モデル + チューニング) ⚠️ ファインチューニング手法: フルファインチューニング / PEFT (LoRA / Adapter) / RLHF。コストと精度のトレードオフ

3.3 訓練に適したハードウェアの選定

🔑 CPU / GPU (A100 / H100) / TPU v4/v5e/v5p / Multislice / Pathways ⚠️ 大規模 LLM → TPU マルチスライス、中規模 CNN → GPU、小規模 ML → CPU で十分 ⚠️ データ並列 = 同じモデル × 異なるデータ、モデル並列 = モデルを分割。両方を組み合わせる 3D 並列 (data / tensor / pipeline) が大規模 LLM 訓練の主流


📡 セクション4:モデルのサービングとスケール(~20%)★最重要

推論基盤の設計と運用。プロダクション化の核心。

4.1 モデルのサービング

🔑 Agent Platform Inference (旧 Vertex AI Endpoints) / Model Registry / Cloud Run / GKE / TF Serving / TorchServe ⚠️ レイテンシ重視 → オンライン推論エンドポイント、スループット重視 → Batch Prediction、スパイク対応 → Cloud Run、複雑な制御 → GKE ⚠️ カナリア: トラフィック分割を Endpoint で設定。A/B テストは複数モデルバージョン併存

4.2 オンラインモデルサービングのスケール

🔑 Agent Platform Inference / Feature Store / Private Service Connect / Edge TPU / Coral ⚠️ Feature Store のオンライン特徴量取得は ms 級レイテンシ。training-serving skew 回避の鍵 ⚠️ プライベートエンドポイント = VPC ピアリング/Private Service Connect 経由。データ漏洩防止と低レイテンシ ⚠️ Edge デプロイ: モバイル/IoT → TensorFlow Lite / Edge TPU、量子化と剪定が必須


⛓ セクション5:ML パイプラインの自動化とオーケストレーション(~18%)

CI/CD/CT で再現可能なMLパイプライン。MLOps の心臓部。

5.1 エンドツーエンド ML パイプラインの開発

🔑 Agent Platform Pipelines (KFP) / Managed Airflow (Cloud Composer) / Ray on Agent Platform / TFX ⚠️ KFP DAGがコンテナ前提・依存単純 → Agent Platform Pipelines、複雑な依存・既存Airflow資産あり → Managed Airflow、分散ML (RL / 大規模HPT) → Ray ⚠️ Training-Serving Skew 防止:Tensorflow Transform (TFT) や Feature Store で前処理コードを共有

5.2 モデル再訓練の自動化

🔑 Cloud Build / Artifact Registry / Cloud Source Repositories / Agent Platform Pipelines ⚠️ 再訓練のトリガー:スケジュール (定期) / データ量閾値 / データドリフト検知時 / ビジネスメトリクス劣化時 ⚠️ CT = Continuous Training。MLOps レベル 1 から登場、レベル 2 で完全自動化


🛡 セクション6:AI ソリューションのモニタリング(~13%)

安全性、責任あるAI、ドリフト検知。新ガイドで明確に強化された領域。

6.1 AI ソリューションへのリスク特定

🔑 Model Armor / Sensitive Data Protection (旧 DLP) / Explainable AI / Safety Filters ⚠️ Model Armor: プロンプトインジェクション・PII漏洩・有害コンテンツ・ジェイルブレイクを検知する LLM向け WAF ⚠️ Explainable AI: SHAP / Integrated Gradients / Sampled Shapley の3手法。特徴量重要度を可視化

6.2 AI ソリューションのモニタリング・テスト・トラブルシューティング

🔑 Agent Platform Model Monitoring / Cloud Monitoring / Cloud Logging / Gen AI Evaluation Service ⚠️ 4つのドリフト種別の違いは頻出。Data Drift = 入力 X の分布変化、Concept Drift = P(Y|X) の変化、Feature Attribution Drift = 各特徴量の SHAP 値分布変化 ⚠️ Gen AI 評価: 自動評価メトリクス(BLEU / ROUGE / Perplexity)+ LLM-as-a-judge + 人手評価


🎯 学習優先度マトリクス

セクション 比重 難易度 学習優先度 重点ポイント
3. スケール 21% ⭐⭐⭐⭐⭐ モデル選定・分散訓練・HPT・ファインチューニング
4. サービング 20% ⭐⭐⭐⭐⭐ Inference / Feature Store / ロールアウト戦略
5. パイプライン 18% ⭐⭐⭐⭐ Pipelines vs Airflow vs Ray / CI/CD/CT
2. データ管理 16% ⭐⭐⭐⭐ 前処理ツール選定 / 実験管理 / 評価メトリクス
1. ローコード 13% 低〜中 ⭐⭐⭐ BigQuery ML / AutoML / Model Garden
6. モニタリング 13% ⭐⭐⭐ ドリフト4種 / Model Armor / 責任あるAI

本ガイドからの追加論点(試験対策の差別化要素)