模擬試験 1 — Professional Machine Learning Engineer
本番形式:全 50 問・2 時間(1 問あたり約 2 分)。出題比重を本番に合わせて配分(§3=10, §4=10, §5=9, §2=8, §1=7, §6=6)。 多肢選択 / 複数選択。複数選択は問題文末に「(複数選択)」と明記。 必ず 時間を測って 解き、終了後に解答解説を読むこと。目安 70% (35 問) で合格圏内。
問題 1(§1)
EC 企業が BigQuery に保存された購買履歴から 解約予測モデル を最速で構築したい。チームは SQL に習熟。最適は?
A. Dataflow → Cloud Storage → Custom Training B. BigQuery ML で logistic_reg を直接訓練 C. Workbench で pandas + sklearn D. AutoML Tables で UI から訓練
解答
**B**:データが BQ にあり SQL で完結するのが最速・最安。問題 2(§1)
請求書 PDF から金額・品目・日付を構造化抽出するサービスは?
A. Vision API OCR B. Document AI Invoice Parser C. Cloud Functions D. AutoML Vision
解答
**B**:Invoice Parser が事前学習済み。問題 3(§1, 複数選択)
Gemini ベースのアプリのコスト削減策として効果的なもの 2 つ:
A. プロンプトキャッシング B. Batch API(非同期可なジョブ) C. Gemini Ultra に固定 D. ストリーミングモード(コスト削減のため)
解答
**A, B**:D はレイテンシ改善で、コストは下がらない。問題 4(§1)
社内 FAQ チャットボットで、ドキュメントが頻繁に更新される。最適は?
A. Gemini フルファインチューニング B. Gemini + RAG (Vector Search) C. AutoML Text D. BigQuery ML
解答
**B**:頻繁な更新には RAG。問題 5(§1)
商品画像 50 万枚で 100 カテゴリに分類。ML 専門家不在。
A. Vision API B. AutoML Image C. Custom Training + ResNet D. BQML
解答
**B**:自社カテゴリ + コードレス + 高精度。問題 6(§1)
🆕 BigQuery から Gemini をファインチューニングする際の構文は?
A. CREATE MODEL ... OPTIONS(model_type='gemini')
B. CREATE MODEL ... REMOTE WITH CONNECTION ...
C. ML.TUNE_MODEL(...)
D. BigQuery では不可能
解答
**B**:Vertex AI Connection 経由の REMOTE MODEL。問題 7(§1)
🆕 動画生成の Google 基盤モデルは?
A. Imagen B. Veo C. Chirp D. Gemini
解答
**B**:Veo。問題 8(§2)
5 TB のデータを BigQuery で特徴量化したい。
A. BigQuery SQL で完結 B. Dataflow に書き直し C. Workbench に pandas でロード D. Cloud SQL に転送
解答
**A**:SQL で書ける処理は BQ で完結が最安。問題 9(§2)
ストリーミング特徴量を ms 級で取得したい。
A. Pub/Sub → Dataflow → Feature Store (Online) B. Pub/Sub → BigQuery → クエリ C. Cloud Function → Cloud SQL D. GCS → Cloud Storage
解答
**A**:ms 級は Feature Store Online。問題 10(§2)
🆕 LLM 出力を継続評価したい。
A. Cloud Logging のみ B. Gen AI Evaluation Service (LLM-as-a-judge) C. BLEU だけ D. 人手のみ
解答
**B**:マネージドの統合評価サービス。問題 11(§2)
複数 ML エンジニアが共同編集できるノートブックは?
A. Workbench B. Colab Enterprise C. ローカル Jupyter D. Cloud Functions
解答
**B**:Google Docs ライクな協業。問題 12(§2)
既存 PySpark ジョブをクラスタ管理なしで動かしたい。
A. Dataflow に書き直し B. Dataproc Serverless for Spark C. BigQuery D. Cloud Run
解答
**B**:既存 Spark + サーバーレス。問題 13(§2, 複数選択)
訓練と推論の前処理 skew を防ぐ手段 2 つ:
A. TFT B. Feature Store C. クライアント側で実装 D. ノートブックと手動同期
解答
**A, B**。問題 14(§2)
PII 含むデータを BigQuery 列単位でアクセス制御。
A. ポリシータグ B. IAM Project ロール C. CMEK D. Cloud KMS
解答
**A**:列レベルのポリシータグ。問題 15(§2)
実験のパラメータ・メトリクス比較を Google サービスで一元管理。
A. BigQuery 手動 B. Agent Platform Experiments + ML Metadata C. Cloud Logging D. Cloud Source Repositories
解答
**B**。問題 16(§3)
100B LLM の訓練に最適な構成は?
A. A100 単機 B. TPU v5p Multislice + Pathways C. CPU 大規模 D. Cloud Functions
解答
**B**:100B 級は TPU Multislice。問題 17(§3)
7B LLM のドメイン特化を低コストで。
A. Full Fine-tuning B. LoRA / PEFT C. プロンプトのみ D. RLHF
解答
**B**:LoRA は計算量 1/100 で実用精度。問題 18(§3)
時系列予測モデルを BigQuery で。
A. ARIMA_PLUS B. linear_reg C. kmeans D. logistic_reg
解答
**A**:ARIMA_PLUS。問題 19(§3, 複数選択)
訓練の OOM 対策 2 つ:
A. バッチサイズを下げる B. 勾配蓄積 C. 学習率を上げる D. データ量を増やす
解答
**A, B**。問題 20(§3)
ハイパラ最適化をベイズで自動化。
A. Vizier B. Cloud Composer C. AutoML D. Cloud Run
解答
**A**。問題 21(§3)
JAX で開発したモデルに最適なハードウェア。
A. CPU B. GPU C. TPU D. Edge TPU
解答
**C**:JAX は TPU 最適化が強い。問題 22(§3)
訓練コスト 50% 削減の最大レバー。
A. Spot VM + チェックポイント B. リージョン変更 C. インスタンス拡大 D. データ削減
解答
**A**。問題 23(§3)
Spot 枠を確保しやすくする Google サービス。
A. DWS (Dynamic Workload Scheduler) B. Cloud Scheduler C. Cloud Run D. Pub/Sub
解答
**A**。問題 24(§3, 複数選択)
分散並列の正しい説明 2 つ:
A. Data Parallelism = 同じモデル × 異なるデータ B. Tensor Parallelism = モデル内のテンソルを分割 C. Pipeline Parallelism = データの順次処理 D. Random Parallelism
解答
**A, B**。問題 25(§3)
3D 並列を使うケース。
A. 中小 NN B. 1 GPU に乗らない超大規模 LLM C. 単純な前処理 D. バッチ推論
解答
**B**。問題 26(§4)
夜間に全顧客スコアリング。
A. Batch Prediction Job B. Endpoint で順次 C. Cloud Functions D. Workbench
解答
**A**。問題 27(§4)
リアルタイム推薦 < 50ms。
A. Batch B. Endpoint + Feature Store Online C. BQ クエリ D. Airflow DAG
解答
**B**。問題 28(§4)
新モデルを 5% から段階展開。
A. ブルー/グリーン B. カナリア C. シャドウ D. ローリング
解答
**B**。問題 29(§4)
性能を本番影響ゼロで計測。
A. A/B B. カナリア C. シャドウデプロイ D. ローリング
解答
**C**。問題 30(§4, 複数選択)
LLM 推論のコスト最適化 2 つ:
A. プロンプトキャッシング B. Batch API C. Pro モデル固定 D. リージョン全部使う
解答
**A, B**。問題 31(§4)
軽量モデル + アイドル長 + コスト最優先。
A. Endpoint min=1 B. Cloud Run min-instances=0 C. GKE 永続 D. Compute Engine 常時
解答
**B**。問題 32(§4)
IoT カメラでオフライン物体検出。
A. Cloud GPU API B. Edge TPU (Coral) C. CPU クラウド D. Vision API
解答
**B**。問題 33(§4)
機密データを非インターネット経由で推論。
A. Public Endpoint + IAM B. Private Endpoint + PSC C. Cloud Functions 公開 D. VPN 経由 Public
解答
**B**。問題 34(§4)
複数モデルを同 Endpoint で A/B。
A. 別 Endpoint B. traffic_split C. Cloud Load Balancer D. Cloud Functions 振り分け
解答
**B**。問題 35(§4)
100B LLM 高スループット推論バックエンド。
A. CPU B. T4 C. A100/H100 or TPU v5e + vLLM D. Cloud Functions
解答
**C**。問題 36(§5)
ML 専用パイプラインをサーバーレスで。
A. Agent Platform Pipelines (KFP) B. Cloud Functions C. Managed Airflow D. Cloud Run
解答
**A**。問題 37(§5)
ETL + ML 統合、既存 Airflow 資産あり。
A. Pipelines B. Managed Service for Apache Airflow C. Workflows D. Functions
解答
**B**。問題 38(§5)
🆕 RL や大規模 HPT の分散実行。
A. Pipelines B. Ray on Agent Platform C. Workflows D. BQML
解答
**B**。問題 39(§5)
軽量 API 呼び出しを YAML で記述。
A. Workflows B. Pipelines C. Airflow D. Pub/Sub
解答
**A**。問題 40(§5)
データ品質を訓練前に自動検証。
A. TFDV を Pipelines のステップに B. Cloud Monitoring C. Cloud Logging D. BQ 単体
解答
**A**。問題 41(§5)
モデル評価で前バージョン以下ならデプロイ阻止。
A. Pipelines に検証ステップ + 条件分岐 B. デプロイ後検証 C. 手動レビュー D. ML Metadata 任せ
解答
**A**。問題 42(§5, 複数選択)
CT 設計の必須要素 2 つ:
A. Model Monitoring B. Pub/Sub 経由トリガー C. 手動承認のみ D. データ破棄
解答
**A, B**。問題 43(§5)
MLOps Level 2 の特徴。
A. ノートブック手動 B. 訓練自動化のみ C. CI/CD/CT 完全自動化 D. 一切自動化なし
解答
**C**。問題 44(§5)
GCS 新規ファイルでパイプライン起動。
A. Cloud Scheduler cron B. Eventarc → Pipelines C. Functions polling D. 手動
解答
**B**。問題 45(§6)
入力 X の分布が変化。
A. Skew B. Data Drift C. Concept Drift D. Attribution Drift
解答
**B**。問題 46(§6)
P(Y|X) が変化。
A. Skew B. Data Drift C. Concept Drift D. Attribution Drift
解答
**C**。問題 47(§6)
🆕 特徴量の寄与度分布が変化。
A. Feature Attribution Drift B. Data Drift C. Concept Drift D. Skew
解答
**A**。問題 48(§6, 複数選択)
🆕 LLM プロンプトインジェクション対策 2 つ:
A. Model Armor B. Safety Filters C. CMEK D. KMS
解答
**A, B**。問題 49(§6)
表形式モデルの予測理由説明。
A. Sampled Shapley B. Integrated Gradients C. XRAI D. ROC-AUC
解答
**A**。問題 50(§6)
🆕 生成 AI 品質を継続評価するマネージドサービス。
A. Cloud Monitoring B. Gen AI Evaluation Service C. BigQuery D. Looker
解答
**B**。採点とフィードバック
- 45 以上 (90%):シニア合格圏。本番準備完了。
- 35〜44 (70〜88%):合格圏。誤答のセクションを
02_学習資料/で再確認。 - 30〜34 (60〜68%):もう 1 週間で再挑戦。重点的に弱点補強。
- 30 未満:用語集 + 学習資料の基礎に立ち返り。
模擬試験 2 を続けて受けるよりも、まずは 誤答の解説 を一通り読み込み、関連セクションの 03_要点と暗記.md を音読してから挑戦することを推奨。