模擬試験2

模擬試験 2 — Professional Machine Learning Engineer

模擬試験 1 と異なる問題セットを 50 問。模擬試験 1 で 70% を超えてから 挑戦することを推奨。


問題 1(§1)

🆕 OSS の Llama 3 モデルを Google Cloud 上で使う最も簡単な方法。

A. GKE で自前構築 B. Model Garden から 1-click デプロイ C. BigQuery ML にインポート D. AutoML で再訓練

解答**B**。

問題 2(§1)

10,000 件のレビューを BigQuery で感情分析(SQL のみで完結したい)。

A. CSV エクスポート → pandas B. ML.GENERATE_TEXT で Gemini Flash を呼び出す C. Dataflow → Cloud Functions D. AutoML Text Sentiment

解答**B**:BigQuery 内から Gemini を SQL で呼べる。

問題 3(§1)

クラウド未経験のチームがコードレスで構造化データの分類モデル。

A. BigQuery ML SQL B. AutoML Tables (UI) C. Custom Training + Workbench D. Cloud Functions

解答**B**。

問題 4(§1, 複数選択)

Gemini レイテンシ削減 2 つ

A. プロンプトキャッシング B. ストリーミング応答 C. 入出力大量化 D. Ultra に切替

解答**A, B**。

問題 5(§1)

医療用語の翻訳精度向上。

A. AutoML Translation または Glossary B. Gemini Pro プロンプトに「医療」 C. BQML ML.TRANSLATE 汎用 D. 人手レビュー全件

解答**A**。

問題 6(§1)

🆕 Gemini ベースアプリの最適化対象 3 つ(新ガイド明記)。

A. コスト・レイテンシ・可用性 B. 精度・再現率・F1 C. プロンプト・コンテキスト・出力 D. PII・有害性・バイアス

解答**A**。

問題 7(§1)

PDF 帳票から品目・金額を抽出 + 自社特殊書式に対応。

A. Vision API OCR + 自作パーサ B. Document AI Custom Extractor C. AutoML Vision D. Translation API

解答**B**。

問題 8(§2)

機微データを LLM プロンプトに入れる前のチェック 2 つ(複数選択):

A. DLP で PII マスキング B. Model Armor で入力チェック C. 公衆 HTTPS で送信 D. 生のままユーザー返却

解答**A, B**。

問題 9(§2)

Feature Store の point-in-time correctness の目的。

A. 将来ラベル混入を防ぐ B. ハードウェア最適化 C. レプリケーション D. GPU 使用率改善

解答**A**。

問題 10(§2)

Workbench コスト爆発の典型対策。

A. Idle Shutdown 設定 B. SLA 引き上げ C. CMEK 無効化 D. 公開 IP

解答**A**。

問題 11(§2)

ML.GENERATE_EMBEDDING の用途。

A. BigQuery 内でベクトル生成、RAG・Vector Search 用 B. 数値の正規化 C. 文字列連結 D. CSV パース

解答**A**。

問題 12(§2)

データ前処理:ストリーミング + バッチ + サーバーレス + Beam SDK。

A. Dataflow B. Dataproc C. Functions D. BQ

解答**A**。

問題 13(§2, 複数選択)

🆕 LLM-as-a-judge のバイアス対策 2 つ

A. position swap B. ペアワイズ比較 C. 1 種類の judge LLM 固定 D. 評価データを公開する

解答**A, B**。

問題 14(§2)

ML パイプラインの系統 (lineage) 管理。

A. Cloud Logging B. ML Metadata C. BQ Information Schema D. Audit Logs

解答**B**。

問題 15(§2)

🆕 開発・実験環境を framework で選ぶ際の選択肢に含まれるもの(公式記載)。

A. Experiments / Pipelines / Kubeflow Pipelines B. Cloud Run only C. Functions only D. App Engine

解答**A**。

問題 16(§3)

XGBoost で表形式モデルを最高精度で。データは BQ。

A. BQML boosted_tree B. AutoML Tables / Tabular Workflows C. Custom Training + XGBoost フレームワーク D. すべて

解答**C**:精度最優先 + フル制御 = Custom Training。BQML/AutoML も候補だが、最高精度なら Custom Training の XGBoost が伸び代大きい。試験では文脈次第で C/B が分かれる。

問題 17(§3)

Vizier で同時試行数を増やすと。

A. 高速化するが探索効率は下がる B. 探索効率が必ず上がる C. コストが下がる D. 精度が必ず上がる

解答**A**。

問題 18(§3)

複数 TPU を単一プログラムで扱う Google 製ランタイム。

A. Pathways B. NCCL C. Horovod D. DeepSpeed

解答**A**。

問題 19(§3)

データの I/O ボトルネック解消 2 つ(複数選択):

A. TFRecord で sequential read B. tf.data の prefetch/cache C. CSV を 1 行ずつ D. GCS から 1 ファイルずつ DL

解答**A, B**。

問題 20(§3)

訓練 loss が NaN。原因として最頻出 2 つ。

A. 学習率が高すぎる B. 混合精度の overflow C. データ多すぎ D. GPU 古い

解答**A, B**。

問題 21(§3)

Tabular Workflows と AutoML Tables の関係。

A. パイプライン化されたカスタマイズ可能な AutoML 上位互換 B. 時系列専用 C. GCS 専用 D. 同じ

解答**A**。

問題 22(§3)

100 B LLM の訓練フレームワーク + ハードウェアの Google 標準。

A. PyTorch + A100 単機 B. JAX + TPU v5p Multislice + Pathways C. sklearn + CPU D. XGBoost + GPU

解答**B**。

問題 23(§3)

7B LLM ファインチューニングをコスト効率良く。

A. Full FT B. LoRA / PEFT C. プロンプトのみ D. RLHF

解答**B**。

問題 24(§3)

🆕 BigQuery 経由 Gemini チューニング SFT 実行。

A. CREATE MODEL ... REMOTE WITH CONNECTION ... B. ML.TUNE_MODEL C. CREATE MODEL ... OPTIONS(model_type='gemini') D. 不可能

解答**A**。

問題 25(§3)

推論コスト最適なハードウェア(中規模 LLM 推論)。

A. A100 B. H100 C. L4 GPU or TPU v5e D. CPU only

解答**C**。

問題 26(§4)

Endpoint コールドスタート問題の対策。

A. min_replicas ≥ 1 B. リージョン変更 C. CPU 増 D. 何もしない

解答**A**。

問題 27(§4, 複数選択)

PyTorch と TensorFlow を同 Endpoint に同居 2 つ

A. 別カスタムコンテナで DeployedModel を 2 つ B. traffic_split で振り分け C. ONNX に統一しないと不可能 D. 1 ファイル統合

解答**A, B**。

問題 28(§4)

訓練/推論の前処理 skew で精度低下。

A. クライアント側全部 B. TFT / Feature Store C. 全部推論に移植 D. ML エンジニア週次同期

解答**B**。

問題 29(§4)

Edge デプロイ前の必須処理。

A. INT8/Float16 量子化 B. 全層 freeze C. 学習率上げる D. データ拡張

解答**A**。

問題 30(§4)

Gemini Nano の用途。

A. クラウド最高性能 LLM B. オンデバイス推論 C. 画像生成 D. 動画認識

解答**B**。

問題 31(§4)

特徴量取得 300ms ボトルネック → 100ms 要件。

A. Feature Store Online B. DB スケールアップ C. Cloud Functions 移行 D. キャッシュなし

解答**A**。

問題 32(§4, 複数選択)

Cloud Run で生成 AI 推論を動かす利点 2 つ

A. スケールゼロ B. GPU 対応 C. K8s 管理必須 D. リクエスト同時数で課金

解答**A, B**。

問題 33(§4)

即ロールバック可能な戦略。

A. ローリング B. ブルー/グリーン C. カナリア小規模 D. 全置換

解答**B**。

問題 34(§4)

複雑な前処理(リサイズ・正規化)を推論時に。

A. クライアント B. カスタムコンテナで前処理 + 推論 C. 別 Cloud Function D. 推論しない

解答**B**。

問題 35(§4)

95% 標準アクセス + 5% バースト。最適スケール。

A. min=高 max=高 固定 B. min=1〜中 max=高 オートスケール C. Cloud Run min=0 D. GKE 永続

解答**B**。

問題 36(§5)

KFP v2 キャッシュ判定。

A. 入力ハッシュ B. 時刻 C. ユーザー名 D. リージョン

解答**A**。

問題 37(§5)

「Cloud Composer」新名称。

A. Managed Service for Apache Airflow B. Cloud Workflows C. Agent Platform Pipelines D. Cloud Build

解答**A**。

問題 38(§5)

Ray on Agent Platform が不適切なシナリオ。

A. RL ロールアウト B. 数千試行 HPT C. 大規模 LLM 分散 FT D. 単発 SQL クエリ

解答**D**:SQL は BQ。

問題 39(§5, 複数選択)

再訓練の適切なトリガー 2 つ

A. スケジュール B. データドリフト検知 C. 課金額増加 D. ユーザー数減少

解答**A, B**。

問題 40(§5)

Pipelines 失敗ステップだけ再走。

A. 全体再実行 B. KFP v2 キャッシュ + 部分再実行 C. 手動複製 D. 不可

解答**B**。

問題 41(§5)

E2E ML パイプラインの第一選択。

A. Agent Platform Pipelines B. Workflows C. Pub/Sub のみ D. Cloud Build のみ

解答**A**。

問題 42(§5)

KFP コンポーネントのリトライ設定。

A. retry_policy で設定 B. リトライ不可 C. 全部再実行 D. Workflows 必須

解答**A**。

問題 43(§5)

CT (Continuous Training)。

A. データ変化に応じた自動再訓練 B. 訓練 1 回のみ C. 推論のみ自動化 D. 全手動

解答**A**。

問題 44(§6)

訓練/推論前処理ズレ。

A. Training-Serving Skew B. Data Drift C. Concept Drift D. Network Skew

解答**A**。

問題 45(§6, 複数選択)

PII 含む LLM レスポンスの漏洩対策 2 つ

A. Model Armor 出力スキャン B. DLP 後段スキャン C. ログ全削除 D. Gemini Pro 切替

解答**A, B**。

問題 46(§6)

公平性で属性ごとの陽性予測率差を測る指標。

A. Demographic Parity B. Equalized Odds C. Accuracy D. F1

解答**A**。

問題 47(§6, 複数選択)

🆕 Model Armor が防げる脅威 2 つ

A. プロンプトインジェクション B. PII 漏洩 C. ハードウェア障害 D. 課金エラー

解答**A, B**。

問題 48(§6)

ドリフト検知 → 自動再訓練。

A. Model Monitoring → Pub/Sub → Pipelines B. 手動メール C. ログ確認のみ D. デプロイ全停止

解答**A**。

問題 49(§6)

差分プライバシーの役割。

A. 訓練データに数学的ノイズで個人特定防止 B. 暗号化 C. レイテンシ削減 D. コスト削減

解答**A**。

問題 50(§6, 複数選択)

Model Monitoring 監視対象 2 つ

A. 入力特徴量のドリフト B. 予測値の分布変化 C. ハードウェア温度 D. 課金通貨

解答**A, B**。

採点

模試 1 と模試 2 の両方で 70% 以上を取れたら本番予約 OK。直前は 03_要点と暗記.md の音読で仕上げ。