模擬試験1

模擬試験 1 — Professional Machine Learning Engineer

本番形式:全 50 問・2 時間(1 問あたり約 2 分)。出題比重を本番に合わせて配分(§3=10, §4=10, §5=9, §2=8, §1=7, §6=6)。 多肢選択 / 複数選択。複数選択は問題文末に「(複数選択)」と明記。 必ず 時間を測って 解き、終了後に解答解説を読むこと。目安 70% (35 問) で合格圏内。


問題 1(§1)

EC 企業が BigQuery に保存された購買履歴から 解約予測モデル を最速で構築したい。チームは SQL に習熟。最適は?

A. Dataflow → Cloud Storage → Custom Training B. BigQuery ML で logistic_reg を直接訓練 C. Workbench で pandas + sklearn D. AutoML Tables で UI から訓練

解答**B**:データが BQ にあり SQL で完結するのが最速・最安。

問題 2(§1)

請求書 PDF から金額・品目・日付を構造化抽出するサービスは?

A. Vision API OCR B. Document AI Invoice Parser C. Cloud Functions D. AutoML Vision

解答**B**:Invoice Parser が事前学習済み。

問題 3(§1, 複数選択)

Gemini ベースのアプリのコスト削減策として効果的なもの 2 つ

A. プロンプトキャッシング B. Batch API(非同期可なジョブ) C. Gemini Ultra に固定 D. ストリーミングモード(コスト削減のため)

解答**A, B**:D はレイテンシ改善で、コストは下がらない。

問題 4(§1)

社内 FAQ チャットボットで、ドキュメントが頻繁に更新される。最適は?

A. Gemini フルファインチューニング B. Gemini + RAG (Vector Search) C. AutoML Text D. BigQuery ML

解答**B**:頻繁な更新には RAG。

問題 5(§1)

商品画像 50 万枚で 100 カテゴリに分類。ML 専門家不在。

A. Vision API B. AutoML Image C. Custom Training + ResNet D. BQML

解答**B**:自社カテゴリ + コードレス + 高精度。

問題 6(§1)

🆕 BigQuery から Gemini をファインチューニングする際の構文は?

A. CREATE MODEL ... OPTIONS(model_type='gemini') B. CREATE MODEL ... REMOTE WITH CONNECTION ... C. ML.TUNE_MODEL(...) D. BigQuery では不可能

解答**B**:Vertex AI Connection 経由の REMOTE MODEL。

問題 7(§1)

🆕 動画生成の Google 基盤モデルは?

A. Imagen B. Veo C. Chirp D. Gemini

解答**B**:Veo。

問題 8(§2)

5 TB のデータを BigQuery で特徴量化したい。

A. BigQuery SQL で完結 B. Dataflow に書き直し C. Workbench に pandas でロード D. Cloud SQL に転送

解答**A**:SQL で書ける処理は BQ で完結が最安。

問題 9(§2)

ストリーミング特徴量を ms 級で取得したい。

A. Pub/Sub → Dataflow → Feature Store (Online) B. Pub/Sub → BigQuery → クエリ C. Cloud Function → Cloud SQL D. GCS → Cloud Storage

解答**A**:ms 級は Feature Store Online。

問題 10(§2)

🆕 LLM 出力を継続評価したい。

A. Cloud Logging のみ B. Gen AI Evaluation Service (LLM-as-a-judge) C. BLEU だけ D. 人手のみ

解答**B**:マネージドの統合評価サービス。

問題 11(§2)

複数 ML エンジニアが共同編集できるノートブックは?

A. Workbench B. Colab Enterprise C. ローカル Jupyter D. Cloud Functions

解答**B**:Google Docs ライクな協業。

問題 12(§2)

既存 PySpark ジョブをクラスタ管理なしで動かしたい。

A. Dataflow に書き直し B. Dataproc Serverless for Spark C. BigQuery D. Cloud Run

解答**B**:既存 Spark + サーバーレス。

問題 13(§2, 複数選択)

訓練と推論の前処理 skew を防ぐ手段 2 つ

A. TFT B. Feature Store C. クライアント側で実装 D. ノートブックと手動同期

解答**A, B**。

問題 14(§2)

PII 含むデータを BigQuery 列単位でアクセス制御。

A. ポリシータグ B. IAM Project ロール C. CMEK D. Cloud KMS

解答**A**:列レベルのポリシータグ。

問題 15(§2)

実験のパラメータ・メトリクス比較を Google サービスで一元管理。

A. BigQuery 手動 B. Agent Platform Experiments + ML Metadata C. Cloud Logging D. Cloud Source Repositories

解答**B**。

問題 16(§3)

100B LLM の訓練に最適な構成は?

A. A100 単機 B. TPU v5p Multislice + Pathways C. CPU 大規模 D. Cloud Functions

解答**B**:100B 級は TPU Multislice。

問題 17(§3)

7B LLM のドメイン特化を低コストで。

A. Full Fine-tuning B. LoRA / PEFT C. プロンプトのみ D. RLHF

解答**B**:LoRA は計算量 1/100 で実用精度。

問題 18(§3)

時系列予測モデルを BigQuery で。

A. ARIMA_PLUS B. linear_reg C. kmeans D. logistic_reg

解答**A**:ARIMA_PLUS。

問題 19(§3, 複数選択)

訓練の OOM 対策 2 つ

A. バッチサイズを下げる B. 勾配蓄積 C. 学習率を上げる D. データ量を増やす

解答**A, B**。

問題 20(§3)

ハイパラ最適化をベイズで自動化。

A. Vizier B. Cloud Composer C. AutoML D. Cloud Run

解答**A**。

問題 21(§3)

JAX で開発したモデルに最適なハードウェア。

A. CPU B. GPU C. TPU D. Edge TPU

解答**C**:JAX は TPU 最適化が強い。

問題 22(§3)

訓練コスト 50% 削減の最大レバー。

A. Spot VM + チェックポイント B. リージョン変更 C. インスタンス拡大 D. データ削減

解答**A**。

問題 23(§3)

Spot 枠を確保しやすくする Google サービス。

A. DWS (Dynamic Workload Scheduler) B. Cloud Scheduler C. Cloud Run D. Pub/Sub

解答**A**。

問題 24(§3, 複数選択)

分散並列の正しい説明 2 つ

A. Data Parallelism = 同じモデル × 異なるデータ B. Tensor Parallelism = モデル内のテンソルを分割 C. Pipeline Parallelism = データの順次処理 D. Random Parallelism

解答**A, B**。

問題 25(§3)

3D 並列を使うケース。

A. 中小 NN B. 1 GPU に乗らない超大規模 LLM C. 単純な前処理 D. バッチ推論

解答**B**。

問題 26(§4)

夜間に全顧客スコアリング。

A. Batch Prediction Job B. Endpoint で順次 C. Cloud Functions D. Workbench

解答**A**。

問題 27(§4)

リアルタイム推薦 < 50ms。

A. Batch B. Endpoint + Feature Store Online C. BQ クエリ D. Airflow DAG

解答**B**。

問題 28(§4)

新モデルを 5% から段階展開。

A. ブルー/グリーン B. カナリア C. シャドウ D. ローリング

解答**B**。

問題 29(§4)

性能を本番影響ゼロで計測。

A. A/B B. カナリア C. シャドウデプロイ D. ローリング

解答**C**。

問題 30(§4, 複数選択)

LLM 推論のコスト最適化 2 つ

A. プロンプトキャッシング B. Batch API C. Pro モデル固定 D. リージョン全部使う

解答**A, B**。

問題 31(§4)

軽量モデル + アイドル長 + コスト最優先。

A. Endpoint min=1 B. Cloud Run min-instances=0 C. GKE 永続 D. Compute Engine 常時

解答**B**。

問題 32(§4)

IoT カメラでオフライン物体検出。

A. Cloud GPU API B. Edge TPU (Coral) C. CPU クラウド D. Vision API

解答**B**。

問題 33(§4)

機密データを非インターネット経由で推論。

A. Public Endpoint + IAM B. Private Endpoint + PSC C. Cloud Functions 公開 D. VPN 経由 Public

解答**B**。

問題 34(§4)

複数モデルを同 Endpoint で A/B。

A. 別 Endpoint B. traffic_split C. Cloud Load Balancer D. Cloud Functions 振り分け

解答**B**。

問題 35(§4)

100B LLM 高スループット推論バックエンド。

A. CPU B. T4 C. A100/H100 or TPU v5e + vLLM D. Cloud Functions

解答**C**。

問題 36(§5)

ML 専用パイプラインをサーバーレスで。

A. Agent Platform Pipelines (KFP) B. Cloud Functions C. Managed Airflow D. Cloud Run

解答**A**。

問題 37(§5)

ETL + ML 統合、既存 Airflow 資産あり。

A. Pipelines B. Managed Service for Apache Airflow C. Workflows D. Functions

解答**B**。

問題 38(§5)

🆕 RL や大規模 HPT の分散実行。

A. Pipelines B. Ray on Agent Platform C. Workflows D. BQML

解答**B**。

問題 39(§5)

軽量 API 呼び出しを YAML で記述。

A. Workflows B. Pipelines C. Airflow D. Pub/Sub

解答**A**。

問題 40(§5)

データ品質を訓練前に自動検証。

A. TFDV を Pipelines のステップに B. Cloud Monitoring C. Cloud Logging D. BQ 単体

解答**A**。

問題 41(§5)

モデル評価で前バージョン以下ならデプロイ阻止。

A. Pipelines に検証ステップ + 条件分岐 B. デプロイ後検証 C. 手動レビュー D. ML Metadata 任せ

解答**A**。

問題 42(§5, 複数選択)

CT 設計の必須要素 2 つ

A. Model Monitoring B. Pub/Sub 経由トリガー C. 手動承認のみ D. データ破棄

解答**A, B**。

問題 43(§5)

MLOps Level 2 の特徴。

A. ノートブック手動 B. 訓練自動化のみ C. CI/CD/CT 完全自動化 D. 一切自動化なし

解答**C**。

問題 44(§5)

GCS 新規ファイルでパイプライン起動。

A. Cloud Scheduler cron B. Eventarc → Pipelines C. Functions polling D. 手動

解答**B**。

問題 45(§6)

入力 X の分布が変化。

A. Skew B. Data Drift C. Concept Drift D. Attribution Drift

解答**B**。

問題 46(§6)

P(Y|X) が変化。

A. Skew B. Data Drift C. Concept Drift D. Attribution Drift

解答**C**。

問題 47(§6)

🆕 特徴量の寄与度分布が変化。

A. Feature Attribution Drift B. Data Drift C. Concept Drift D. Skew

解答**A**。

問題 48(§6, 複数選択)

🆕 LLM プロンプトインジェクション対策 2 つ

A. Model Armor B. Safety Filters C. CMEK D. KMS

解答**A, B**。

問題 49(§6)

表形式モデルの予測理由説明。

A. Sampled Shapley B. Integrated Gradients C. XRAI D. ROC-AUC

解答**A**。

問題 50(§6)

🆕 生成 AI 品質を継続評価するマネージドサービス。

A. Cloud Monitoring B. Gen AI Evaluation Service C. BigQuery D. Looker

解答**B**。

採点とフィードバック

模擬試験 2 を続けて受けるよりも、まずは 誤答の解説 を一通り読み込み、関連セクションの 03_要点と暗記.md を音読してから挑戦することを推奨。