模擬試験 2 — Professional Machine Learning Engineer
模擬試験 1 と異なる問題セットを 50 問。模擬試験 1 で 70% を超えてから 挑戦することを推奨。
問題 1(§1)
🆕 OSS の Llama 3 モデルを Google Cloud 上で使う最も簡単な方法。
A. GKE で自前構築 B. Model Garden から 1-click デプロイ C. BigQuery ML にインポート D. AutoML で再訓練
解答
**B**。問題 2(§1)
10,000 件のレビューを BigQuery で感情分析(SQL のみで完結したい)。
A. CSV エクスポート → pandas
B. ML.GENERATE_TEXT で Gemini Flash を呼び出す
C. Dataflow → Cloud Functions
D. AutoML Text Sentiment
解答
**B**:BigQuery 内から Gemini を SQL で呼べる。問題 3(§1)
クラウド未経験のチームがコードレスで構造化データの分類モデル。
A. BigQuery ML SQL B. AutoML Tables (UI) C. Custom Training + Workbench D. Cloud Functions
解答
**B**。問題 4(§1, 複数選択)
Gemini レイテンシ削減 2 つ:
A. プロンプトキャッシング B. ストリーミング応答 C. 入出力大量化 D. Ultra に切替
解答
**A, B**。問題 5(§1)
医療用語の翻訳精度向上。
A. AutoML Translation または Glossary B. Gemini Pro プロンプトに「医療」 C. BQML ML.TRANSLATE 汎用 D. 人手レビュー全件
解答
**A**。問題 6(§1)
🆕 Gemini ベースアプリの最適化対象 3 つ(新ガイド明記)。
A. コスト・レイテンシ・可用性 B. 精度・再現率・F1 C. プロンプト・コンテキスト・出力 D. PII・有害性・バイアス
解答
**A**。問題 7(§1)
PDF 帳票から品目・金額を抽出 + 自社特殊書式に対応。
A. Vision API OCR + 自作パーサ B. Document AI Custom Extractor C. AutoML Vision D. Translation API
解答
**B**。問題 8(§2)
機微データを LLM プロンプトに入れる前のチェック 2 つ(複数選択):
A. DLP で PII マスキング B. Model Armor で入力チェック C. 公衆 HTTPS で送信 D. 生のままユーザー返却
解答
**A, B**。問題 9(§2)
Feature Store の point-in-time correctness の目的。
A. 将来ラベル混入を防ぐ B. ハードウェア最適化 C. レプリケーション D. GPU 使用率改善
解答
**A**。問題 10(§2)
Workbench コスト爆発の典型対策。
A. Idle Shutdown 設定 B. SLA 引き上げ C. CMEK 無効化 D. 公開 IP
解答
**A**。問題 11(§2)
ML.GENERATE_EMBEDDING の用途。
A. BigQuery 内でベクトル生成、RAG・Vector Search 用 B. 数値の正規化 C. 文字列連結 D. CSV パース
解答
**A**。問題 12(§2)
データ前処理:ストリーミング + バッチ + サーバーレス + Beam SDK。
A. Dataflow B. Dataproc C. Functions D. BQ
解答
**A**。問題 13(§2, 複数選択)
🆕 LLM-as-a-judge のバイアス対策 2 つ:
A. position swap B. ペアワイズ比較 C. 1 種類の judge LLM 固定 D. 評価データを公開する
解答
**A, B**。問題 14(§2)
ML パイプラインの系統 (lineage) 管理。
A. Cloud Logging B. ML Metadata C. BQ Information Schema D. Audit Logs
解答
**B**。問題 15(§2)
🆕 開発・実験環境を framework で選ぶ際の選択肢に含まれるもの(公式記載)。
A. Experiments / Pipelines / Kubeflow Pipelines B. Cloud Run only C. Functions only D. App Engine
解答
**A**。問題 16(§3)
XGBoost で表形式モデルを最高精度で。データは BQ。
A. BQML boosted_tree B. AutoML Tables / Tabular Workflows C. Custom Training + XGBoost フレームワーク D. すべて
解答
**C**:精度最優先 + フル制御 = Custom Training。BQML/AutoML も候補だが、最高精度なら Custom Training の XGBoost が伸び代大きい。試験では文脈次第で C/B が分かれる。問題 17(§3)
Vizier で同時試行数を増やすと。
A. 高速化するが探索効率は下がる B. 探索効率が必ず上がる C. コストが下がる D. 精度が必ず上がる
解答
**A**。問題 18(§3)
複数 TPU を単一プログラムで扱う Google 製ランタイム。
A. Pathways B. NCCL C. Horovod D. DeepSpeed
解答
**A**。問題 19(§3)
データの I/O ボトルネック解消 2 つ(複数選択):
A. TFRecord で sequential read B. tf.data の prefetch/cache C. CSV を 1 行ずつ D. GCS から 1 ファイルずつ DL
解答
**A, B**。問題 20(§3)
訓練 loss が NaN。原因として最頻出 2 つ。
A. 学習率が高すぎる B. 混合精度の overflow C. データ多すぎ D. GPU 古い
解答
**A, B**。問題 21(§3)
Tabular Workflows と AutoML Tables の関係。
A. パイプライン化されたカスタマイズ可能な AutoML 上位互換 B. 時系列専用 C. GCS 専用 D. 同じ
解答
**A**。問題 22(§3)
100 B LLM の訓練フレームワーク + ハードウェアの Google 標準。
A. PyTorch + A100 単機 B. JAX + TPU v5p Multislice + Pathways C. sklearn + CPU D. XGBoost + GPU
解答
**B**。問題 23(§3)
7B LLM ファインチューニングをコスト効率良く。
A. Full FT B. LoRA / PEFT C. プロンプトのみ D. RLHF
解答
**B**。問題 24(§3)
🆕 BigQuery 経由 Gemini チューニング SFT 実行。
A. CREATE MODEL ... REMOTE WITH CONNECTION ... B. ML.TUNE_MODEL C. CREATE MODEL ... OPTIONS(model_type='gemini') D. 不可能
解答
**A**。問題 25(§3)
推論コスト最適なハードウェア(中規模 LLM 推論)。
A. A100 B. H100 C. L4 GPU or TPU v5e D. CPU only
解答
**C**。問題 26(§4)
Endpoint コールドスタート問題の対策。
A. min_replicas ≥ 1 B. リージョン変更 C. CPU 増 D. 何もしない
解答
**A**。問題 27(§4, 複数選択)
PyTorch と TensorFlow を同 Endpoint に同居 2 つ:
A. 別カスタムコンテナで DeployedModel を 2 つ B. traffic_split で振り分け C. ONNX に統一しないと不可能 D. 1 ファイル統合
解答
**A, B**。問題 28(§4)
訓練/推論の前処理 skew で精度低下。
A. クライアント側全部 B. TFT / Feature Store C. 全部推論に移植 D. ML エンジニア週次同期
解答
**B**。問題 29(§4)
Edge デプロイ前の必須処理。
A. INT8/Float16 量子化 B. 全層 freeze C. 学習率上げる D. データ拡張
解答
**A**。問題 30(§4)
Gemini Nano の用途。
A. クラウド最高性能 LLM B. オンデバイス推論 C. 画像生成 D. 動画認識
解答
**B**。問題 31(§4)
特徴量取得 300ms ボトルネック → 100ms 要件。
A. Feature Store Online B. DB スケールアップ C. Cloud Functions 移行 D. キャッシュなし
解答
**A**。問題 32(§4, 複数選択)
Cloud Run で生成 AI 推論を動かす利点 2 つ:
A. スケールゼロ B. GPU 対応 C. K8s 管理必須 D. リクエスト同時数で課金
解答
**A, B**。問題 33(§4)
即ロールバック可能な戦略。
A. ローリング B. ブルー/グリーン C. カナリア小規模 D. 全置換
解答
**B**。問題 34(§4)
複雑な前処理(リサイズ・正規化)を推論時に。
A. クライアント B. カスタムコンテナで前処理 + 推論 C. 別 Cloud Function D. 推論しない
解答
**B**。問題 35(§4)
95% 標準アクセス + 5% バースト。最適スケール。
A. min=高 max=高 固定 B. min=1〜中 max=高 オートスケール C. Cloud Run min=0 D. GKE 永続
解答
**B**。問題 36(§5)
KFP v2 キャッシュ判定。
A. 入力ハッシュ B. 時刻 C. ユーザー名 D. リージョン
解答
**A**。問題 37(§5)
「Cloud Composer」新名称。
A. Managed Service for Apache Airflow B. Cloud Workflows C. Agent Platform Pipelines D. Cloud Build
解答
**A**。問題 38(§5)
Ray on Agent Platform が不適切なシナリオ。
A. RL ロールアウト B. 数千試行 HPT C. 大規模 LLM 分散 FT D. 単発 SQL クエリ
解答
**D**:SQL は BQ。問題 39(§5, 複数選択)
再訓練の適切なトリガー 2 つ:
A. スケジュール B. データドリフト検知 C. 課金額増加 D. ユーザー数減少
解答
**A, B**。問題 40(§5)
Pipelines 失敗ステップだけ再走。
A. 全体再実行 B. KFP v2 キャッシュ + 部分再実行 C. 手動複製 D. 不可
解答
**B**。問題 41(§5)
E2E ML パイプラインの第一選択。
A. Agent Platform Pipelines B. Workflows C. Pub/Sub のみ D. Cloud Build のみ
解答
**A**。問題 42(§5)
KFP コンポーネントのリトライ設定。
A. retry_policy で設定 B. リトライ不可 C. 全部再実行 D. Workflows 必須
解答
**A**。問題 43(§5)
CT (Continuous Training)。
A. データ変化に応じた自動再訓練 B. 訓練 1 回のみ C. 推論のみ自動化 D. 全手動
解答
**A**。問題 44(§6)
訓練/推論前処理ズレ。
A. Training-Serving Skew B. Data Drift C. Concept Drift D. Network Skew
解答
**A**。問題 45(§6, 複数選択)
PII 含む LLM レスポンスの漏洩対策 2 つ:
A. Model Armor 出力スキャン B. DLP 後段スキャン C. ログ全削除 D. Gemini Pro 切替
解答
**A, B**。問題 46(§6)
公平性で属性ごとの陽性予測率差を測る指標。
A. Demographic Parity B. Equalized Odds C. Accuracy D. F1
解答
**A**。問題 47(§6, 複数選択)
🆕 Model Armor が防げる脅威 2 つ:
A. プロンプトインジェクション B. PII 漏洩 C. ハードウェア障害 D. 課金エラー
解答
**A, B**。問題 48(§6)
ドリフト検知 → 自動再訓練。
A. Model Monitoring → Pub/Sub → Pipelines B. 手動メール C. ログ確認のみ D. デプロイ全停止
解答
**A**。問題 49(§6)
差分プライバシーの役割。
A. 訓練データに数学的ノイズで個人特定防止 B. 暗号化 C. レイテンシ削減 D. コスト削減
解答
**A**。問題 50(§6, 複数選択)
Model Monitoring 監視対象 2 つ:
A. 入力特徴量のドリフト B. 予測値の分布変化 C. ハードウェア温度 D. 課金通貨
解答
**A, B**。採点
- 45+ (90%):本番準備完了。
- 35〜44 (70〜88%):合格圏。
- 30〜34 (60〜68%):あと 1 週間の補強推奨。
- 30 未満:基礎に戻る。
模試 1 と模試 2 の両方で 70% 以上を取れたら本番予約 OK。直前は 03_要点と暗記.md の音読で仕上げ。