PDE 合格対策

問題演習(採点付き)

全セクションから厳選した22問。選択肢をクリックして「採点する」を押すと、正誤判定とその場で解説が表示されます。

💡 使い方① 各問で選択肢を選ぶ(複数選択は指定数だけ)→ ② 「採点する」で自動採点 → ③ 解説の「なぜ他の選択肢がダメか」まで読む。目標は70%以上。本番同様、迷ったら消去法で。

セクション1:データ処理システムの設計

Q1S1🔧単一選択

ある企業はBigQueryのデータにIAMで最小権限を設定済みだが、「認証情報が漏洩した場合に、許可された境界の外へデータが持ち出されること」を防ぎたい。最も適切な追加対策はどれか。

正解:C
IAMが正しくても、認証情報の漏洩や内部不正によるデータ持ち出しは防げない。VPC Service Controls はサービス境界を作り、境界外へのデータ移動をブロックする。
❌ A:権限を広げるだけで逆効果。❌ B:暗号化は保存データ保護で持ち出し自体は防げない。❌ D:PII保護であって境界防御ではない。
Q2S1🔧単一選択

規制要件により、暗号鍵をGoogle Cloudに一切預けず、自社のオンプレで完全に保持・管理する必要がある。適切な暗号化方式は。

正解:B
CSEKは鍵を自分で持ち込み、GCPに保管しない方式。「鍵をGCPに預けない」厳格な要件に合致。
❌ A:Googleが鍵を管理。❌ C:鍵はKMS(GCP内)に保管される。❌ D:CMEKの一機能でGCP内保管。
Q3S1🎯単一選択

オンプレに800TBの履歴データがあり、Google Cloudへ移行したい。利用可能なネットワーク帯域では転送に数ヶ月かかる見込み。最適な方法は。

正解:A
ネットワーク転送が非現実的な大容量(数十TB〜PB)は、物理アプライアンスでオフライン転送するTransfer Applianceが最適。
❌ B:オンライン転送で帯域がボトルネック。❌ C:DBの継続的CDC用。❌ D:SaaS/他DWHからの定期取り込み用。
Q4S1🔧複数選択(2つ選べ)

アナリストには売上の集計結果だけを見せ、元テーブルの個人情報列(氏名・メール)には直接アクセスさせたくない。適切な手法を2つ選べ。

正解:A, C
承認済みビューは元テーブルへの権限なしで結果だけ共有でき、ポリシータグは列単位でアクセスを制御できる。
❌ B:オーナーは強すぎて全データにアクセス可能。❌ D:データ自体が失われ業務不能。

セクション2:データの取り込みと処理

Q5S2📘単一選択

大量のセンサーデータをリアルタイムにストリーミング処理したい。インフラ管理の手間を最小化し、自動スケールするサービスは。

正解:B
Dataflow(Apache Beam)はサーバーレスでバッチ/ストリーミングを統一的に扱い、自動スケールする。運用負荷最小のストリーミングに最適。
❌ A:クラスタ管理が必要で、主に既存Spark/Hadoop向け。❌ C:管理負荷が最大。❌ D:リアルタイムストリーミング処理ではない。
Q6S2🔧単一選択

オンプレで稼働している既存のApache Spark/Hadoopジョブを、コードをほぼ変えずにGoogle Cloudへ移行したい。最適なサービスは。

正解:A
DataprocはマネージドなSpark/Hadoopで、既存資産をほぼそのまま移行できる。
❌ B:Beamモデルへの書き換えが必要。❌ C:GUIのETLツールで別物。❌ D:メッセージングであり処理エンジンではない。
Q7S2🎯単一選択

ユーザーのWebサイト訪問を、無操作が30分続いたら1セッションとして区切って集計したい。Dataflowで使うべきウィンドウは。

正解:C
セッションウィンドウは「一定の非アクティブ間隔(ギャップ)」でデータをグループ化する。ユーザーの活動セッションの集計に最適。
❌ A:固定長で区切る。❌ B:重なり合う一定長。❌ D:区切りなし(全体)。
Q8S2🔧単一選択

複数のジョブ(抽出→変換→ロード→通知)に複雑な依存関係があり、リトライや条件分岐を含むワークフローとして管理・スケジュールしたい。最適なサービスは。

正解:B
Cloud Composer(マネージドAirflow)はDAGで複雑な依存関係・リトライ・分岐を持つワークフローを管理できる。
❌ A:単純なcronトリガーで依存管理不可。❌ C:メッセージングで依存オーケストレーションではない。❌ D:単発処理で複雑なDAG管理に不向き。
Q9S2🎯複数選択(2つ選べ)

Pub/Subに関する記述として正しいものを2つ選べ。

正解:A, D
Pub/Subはグローバルなメッセージングで、配信失敗メッセージをデッドレタートピックに退避できる。
❌ B:ウィンドウ集計はDataflow側の役割。❌ C:DWHはBigQuery。Pub/Subは取り込み・連携用。

セクション3:データの保存

Q10S3🔧単一選択

グローバルに展開する決済システムで、世界中で強整合なACIDトランザクションと、無停止の水平スケールが必要。最適なストレージは。

正解:C
Spannerはグローバル分散・水平スケール・強整合をTrueTimeで実現する唯一のRDB。
❌ A:リージョナルで、グローバル分散・無制限の水平スケールは不可。❌ B:結果整合(単一行のみ強整合)で複数行ACID不可。❌ D:ドキュメント型でグローバル決済の用途ではない。
Q11S3📘単一選択

車両IoTから毎秒数百万件の書き込みがあり、直近の位置をミリ秒で読みたい。結果整合性で問題ない。最適なストレージは。

正解:B
Bigtableはワイドカラム型NoSQLで、ミリ秒の低レイテンシ・毎秒大量の読み書きにスケールする。時系列・IoTの定番。
❌ A:分析用で1行のミリ秒参照や大量書き込みには不向き。❌ C:リージョナルRDBでこの規模の書き込みに不適。❌ D:オブジェクトストレージでキー参照のDBではない。
Q12S3🔧複数選択(2つ選べ)

BigQueryの大規模テーブルに対するクエリコストを下げたい。効果的な施策を2つ選べ。

正解:A, B
BigQueryのコスト=スキャン量。パーティション(プルーニング)と必要列のみSELECTでスキャン量を削減できる(+クラスタリング)。
❌ C:BigQueryは非正規化が基本。JOIN増加はむしろ非効率。❌ D:意味をなさない選択肢。
Q13S3📘単一選択

法令で7年間の保持が義務付けられた書類画像。ほとんど読み出さないが削除はできない。最もコストが低い保存方法は。

正解:D
めったに読まず長期保管するならArchiveクラスが最も保存料が安い(ライフサイクルでStandard→Archiveも可)。
❌ A:ホット用で保存料が高い。❌ B:画像の長期保管用途ではない。❌ C:低レイテンシ参照用で高コスト。
Q14S3🎯複数選択(2つ選べ)

Bigtableで書き込みが一部ノードに集中して性能が出ない。ホットスポットを回避する行キー設計を2つ選べ。

正解:B, C
識別子を先頭に昇格(フィールドプロモーション)し時刻を後置する、またはハッシュ接頭辞で分散(ソルティング)するとホットスポットを回避できる。
❌ A・D:タイムスタンプや連番が先頭だと最新書き込みが単一ノードに集中し、まさにホットスポットの原因。

セクション4:分析のためのデータ準備

Q15S4🔧単一選択

BigQueryに接続したBIダッシュボードの応答が遅い。インメモリ高速化でサブ秒の応答にしたい。使うべき機能は。

正解:B
BI EngineはBigQueryのインメモリ高速化エンジンで、ダッシュボードを低レイテンシ化する(マテビュー併用も有効)。
❌ A:PII保護。❌ C:CDC。❌ D:オーケストレーション。いずれもBI高速化の機能ではない。
Q16S4🎯単一選択

データアナリストが、BigQueryのデータに対しSQLだけで売上の時系列予測モデルを作りたい。専用のML基盤は持ちたくない。最適なのは。

正解:C
SQLだけでMLができるBigQuery MLが適し、時系列予測には専用のARIMA_PLUSモデルを使う。
❌ A:別途ML基盤が必要で要件に反する。❌ B:時系列予測には線形回帰より時系列専用モデルが適切。❌ D:可視化機能で予測モデルではない。
Q17S4🔧単一選択

パートナー企業と大規模データセットを共有したいが、データを物理的にコピー・エクスポートしたくない。最適な方法は。

正解:A
Analytics Hubはデータをコピーせず、参照型で組織間共有できる(リスティングを購読)。
❌ B・C:コピーが発生し、ガバナンス・鮮度・コストの問題。❌ D:公開は情報漏洩リスクが高くアクセス制御も困難。
Q18S4🔧単一選択

BigQueryのテーブルで、特定の機密列(給与)だけを一部のユーザーから隠したい。最も適切な機能は。

正解:B
ポリシータグを機密列に付与すると、列レベルでアクセスを制御でき、権限のないユーザーにはその列だけ見せられる。
❌ A:テーブル単位では列ごとの制御ができない。❌ C:コスト/性能の機能でセキュリティではない。❌ D:運用が煩雑で同期の問題が生じる。

セクション5:保守と自動化

Q19S5🎯単一選択

日次のSparkバッチをDataprocで実行している。コストを最小化したい。最適な構成は。

正解:C
コスト最適化の定番は、ジョブ完了後に破棄するephemeral(ジョブ単位)クラスタ+永続データはCloud Storage(HDFSに残さない)。
❌ A・D:アイドル時間のコストが無駄。❌ B:クラスタ破棄でデータが失われる前提に反する。
Q20S5🔧単一選択

BigQueryで毎日大量かつ予測可能なクエリが走り、オンデマンド課金だとコストが高騰している。コストを平準化する最適な方法は。

正解:B
大量・予測可能なワークロードは、スロットを確保する容量ベース(Editions/予約)で定額化しコストを平準化できる。
❌ A・C:業務が成立しない。❌ D:問題が解決しない。
Q21S5🔧単一選択

BigQueryのテーブルから誤って大量の行を削除してしまった。3日前の状態に戻したい。最も簡単な方法は。

正解:C
BigQueryのタイムトラベルは過去7日間のデータにアクセス・復元できる(FOR SYSTEM_TIME AS OF)。3日前なら復旧可能。
❌ A:7日以内なら可能。❌ B:非効率で正確性に欠ける。❌ D:境界セキュリティでデータ復旧とは無関係。
Q22S5🎯複数選択(2つ選べ)

あるサービスのデータ層を、リージョン全体の障害に対して耐性を持たせたい。有効な施策を2つ選べ。

正解:A, C
マルチリージョンのデータセットやクロスリージョンのレプリカは、リージョン障害に対する耐性を高める。
❌ B:単一ゾーンは可用性が最も低い。❌ D:Memorystoreは揮発しうるキャッシュで正本にすべきでない。
📚 もっと解きたい各セクションの問題集(計80問)と模擬試験(各50問)はMarkdownにあります:問題集フォルダ模擬試験フォルダ