Section 6: 運用卓越性 — 🎯 要点と暗記
対象: 試験直前確認 / シニアの最終チェック。
目標: 1 セッション 20-30 分で全項目を高速ループ。
⚡ Cloud Observability 4 大柱 + α(即答)
| サービス |
役割 |
| Cloud Monitoring |
メトリクス / Dashboards / Alert / Uptime / SLO |
| Cloud Logging |
ログ集約、Sink、Log-based Metrics、Log Analytics |
| Cloud Trace |
分散トレース(OpenTelemetry 標準対応) |
| Cloud Profiler |
本番常時プロファイリング(CPU/メモリ/Heap) |
| Error Reporting |
例外集約、スタックトレース、影響範囲 |
| Uptime Checks |
外形監視(HTTP/HTTPS/TCP) |
| Managed Service for Prometheus |
PromQL 互換、自動スケール、24 ヶ月保持 |
⚡ SRE 用語(即答)
| 用語 |
内容 |
| SLI |
信頼性の 測定値(実測) |
| SLO |
内部の 目標値 |
| SLA |
顧客との 契約値(罰則あり) |
| エラーバジェット |
1 − SLO(許容できるダウン) |
| Toil |
自動化可能な手作業(50% 以下を目標) |
| Burn Rate |
エラーバジェットの消費速度 |
| DORA メトリクス |
Deploy Frequency / Lead Time / Change Failure Rate / MTTR |
SLO 例の数値(暗記)
| SLO |
月あたりエラーバジェット |
| 99% |
7 時間 18 分 |
| 99.5% |
3 時間 39 分 |
| 99.9% |
43 分 12 秒 |
| 99.95% |
21 分 36 秒 |
| 99.99% |
4 分 19 秒 |
| 99.999% |
25.9 秒 |
⚡ SLI のタイプ(即答)
| タイプ |
例 |
| Availability |
HTTP 成功率 |
| Latency |
p99 が 200ms 以下の割合 |
| Error Rate |
5xx エラー率 |
| Throughput |
RPS / QPS |
| Saturation |
CPU / メモリ / Queue 使用率 |
| Quality |
データ鮮度・正確さ |
⚡ アラート戦略(即答)
| 観点 |
即答 |
| 良いアラート |
症状ベース、アクション可能、SLO Burn Rate ベース |
| Multi-window/Multi-burn-rate |
Fast (5min/14.4x), Medium (1h/6x), Slow (6h/1x) |
| 静的しきい値 |
アラート疲れの元、可能なら避ける |
| ノイズ削減 |
グループ化、Snooze、Notification Channel 振り分け |
| Forecast Alert |
予測ベース(クォータ枯渇予知など) |
Notification Channels の使い分け
| Channel |
用途 |
| PagerDuty / Opsgenie |
Critical、夜間オンコール |
| Slack / Teams |
Warning、チーム共有 |
| Email |
Notice、日次サマリー |
| Webhook |
ChatOps、カスタム |
| SMS / Voice |
緊急時 |
⚡ Cloud Logging の重要事項(即答)
| 項目 |
内容 |
| Sink 先 |
BigQuery / GCS / Pub/Sub / 別 Log Bucket / 外部 SIEM |
| Aggregated Sink |
組織レベルで集約(コンプラ用) |
| Log Buckets |
_Default(30日)、_Required(400日、Audit用) |
| Log Analytics |
BigQuery で SQL 分析 |
| Audit Logs 4 種 |
Admin Activity / Data Access(無効デフォルト) / System Event / Policy Denied |
**「Data Access ログはデフォルト無効、コンプラなら明示有効化」**を必ず暗記。
⚡ デプロイ戦略(即答)
| 戦略 |
用途 |
| Rolling Update |
一般的 |
| Blue-Green |
即時切戻し |
| Canary |
段階リリース |
| Recreate |
全停止 |
| Feature Flag |
コード変更なしで機能 ON/OFF |
| Progressive Delivery |
Canary + Flag + Observability |
| Cloud Deploy Approval |
本番手前で承認 |
⚡ 信頼性検証(即答)
| 種類 |
代表ツール / 目的 |
| Load Test |
Locust / k6 / JMeter(性能) |
| Chaos Engineering |
Chaos Toolkit / Litmus / Gremlin(回復力) |
| Game Day |
障害想定演習 |
| Pentest |
侵入テスト(GCP は事前申請不要) |
| Spike Test |
急増負荷 |
| Soak Test |
長時間負荷でのリーク |
| Endurance |
24h+ 継続負荷 |
Chaos Engineering の 4 原則
1. 定常状態の仮説(SLO 達成)
2. 現実世界の事象を変数化
3. 本番(または近い環境)で実験
4. 自動化・継続実行
⚡ ポリシー / コンプラ(即答)
| ツール |
用途 |
| Organization Policy |
GCP リソースの強制ポリシー |
| Policy Controller |
K8s リソースの強制(Gatekeeper) |
| Open Policy Agent (OPA) |
汎用ポリシーエンジン |
| Security Command Center (SCC) |
中央セキュリティ管理 |
| Cloud Asset Inventory |
リソース棚卸し |
| Assured Workloads |
規制業界(HIPAA / FedRAMP / IL4) |
| Config Sync |
GitOps(Anthos Config Management) |
⚡ Gemini Cloud Assist for Observability(即答)
| 機能 |
用途 |
| Investigations |
障害時のリソース横断分析、原因仮説生成 |
| Log Analytics + Gemini |
自然言語でログ検索・要約 |
| Alert Summarization |
大量アラートを要約 |
| Runbook 生成 |
過去対応からランブック自動生成 |
試験頻出: 「障害時に AI 支援」→ Gemini Cloud Assist Investigations。
⚡ インシデント対応(即答)
| ステップ |
内容 |
| 1. 検知 |
Alert / Uptime Check / 顧客連絡 |
| 2. トリアージ |
影響範囲・優先度 |
| 3. 暫定対応 |
ロールバック / トラフィック切替 |
| 4. 復旧 |
SLO 回復確認 |
| 5. 連絡 |
Status Page / ステークホルダー |
| 6. Postmortem |
Blameless、Five Whys、再発防止策 |
ICS(Incident Command System)
| 役割 |
責任 |
| IC |
全体統率・決断 |
| Communication Lead |
連絡・Status Page |
| Operations Lead |
修復作業 |
| Scribe |
記録 |
| SME |
技術専門家 |
⚡ DORA メトリクス(即答)
| 指標 |
内容 |
良い方向 |
| Deployment Frequency |
デプロイ頻度 |
高い |
| Lead Time for Changes |
コミット→本番時間 |
短い |
| Change Failure Rate |
変更失敗率 |
低い |
| MTTR |
障害復旧時間 |
短い |
「DevOps 成熟度の標準指標」= DORA。
⚡ Operational Excellence の原則(即答)
1. 自動化 ─── Terraform / CI/CD / 自動修復
2. 観測可能性 ─── Monitoring / Logging / Trace / Profiler
3. 継続的改善 ─── Postmortem / DORA / SLO レビュー
4. チームの責任 ─── DevOps / SRE モデル
5. 計画されたリリース ─── Cloud Deploy / Canary / Approval
⚡ 必殺フレーズ(即答)
| 状況 |
即答 |
| 「分散トレース標準」 |
OpenTelemetry + Cloud Trace |
| 「OSS Prometheus 互換」 |
Managed Service for Prometheus |
| 「本番でも軽量プロファイル」 |
Cloud Profiler |
| 「ログ集約・組織横断」 |
Aggregated Sink → BigQuery |
| 「ログを SQL 分析」 |
Log Analytics |
| 「監査ログ(無効デフォルト)」 |
Data Access Audit Logs |
| 「外形監視」 |
Uptime Checks |
| 「障害予測」 |
Forecast-based Alert |
| 「SLO Burn Rate 推奨」 |
Multi-window / Multi-burn-rate |
| 「アラート疲労対策」 |
症状ベース + SLO + ノイズ削減 |
| 「即時切戻し」 |
Blue-Green |
| 「段階リリース」 |
Canary |
| 「コード変更なし切替」 |
Feature Flag |
| 「コンプラ承認」 |
Cloud Deploy Approval |
| 「K8s GitOps」 |
Config Sync / Argo CD |
| 「ポリシー強制(GCP)」 |
Organization Policy |
| 「ポリシー強制(K8s)」 |
Policy Controller (Gatekeeper) |
| 「規制業界統制」 |
Assured Workloads |
| 「障害訓練」 |
Game Day |
| 「自発障害注入」 |
Chaos Engineering |
| 「侵入テスト(事前申請)」 |
不要(規約遵守で可) |
| 「AI 障害分析」 |
Gemini Cloud Assist Investigations |
| 「DevOps 成熟度」 |
DORA メトリクス |
| 「Postmortem の鉄則」 |
Blameless |
⚡ 必ず暗記する数値・名前
- SLO 99.9% → 月 43 分 12 秒 のエラー予算
- SLO 99.99% → 月 4 分 19 秒 のエラー予算
- Burn Rate Multi-window: Fast (5min/14.4x)、Medium (1h/6x)、Slow (6h/1x)
- Audit Logs: Admin Activity / Data Access(無効デフォルト)/ System Event / Policy Denied
- Log Buckets デフォルト保持:
_Default 30 日、_Required 400 日
- Managed Prometheus 保持: 24 ヶ月
- Toil 目標: 50% 以下
- DORA メトリクス: 4 つ(Deploy Freq / Lead Time / CFR / MTTR)
- Pentest GCP 規約: 事前申請不要、DDoS / 他テナント影響は禁止
⚡ サービスリネーム最新
| 旧名 |
新名 |
| Stackdriver |
Cloud Operations / Cloud Observability |
| Stackdriver Monitoring |
Cloud Monitoring |
| Stackdriver Logging |
Cloud Logging |
| Workspaces |
Metrics Scope |
| Anthos Config Management |
Config Sync + Policy Controller |
⚡ ケーススタディの定番解(Section 6 視点)
| ケース |
推奨運用 |
| Altostrat Media |
Cloud Monitoring SLO / Cloud Trace / Canary デプロイ / Game Day |
| Cymbal Retail |
Multi-burn-rate Alert / Feature Flag / Chaos Engineering |
| EHR Healthcare |
Aggregated Sink + BigQuery / Assured Workloads / Data Access Logs 有効 / Pentest |
| KnightMotives Automotive |
Managed Prometheus / Forecast Alert / Cloud Deploy Approval |
⚡ 試験中の判断フローチャート
質問を読む
↓
「運用・観測・信頼性」キーワード抽出
- メトリクス → Cloud Monitoring
- ログ → Cloud Logging(Sink / Log Analytics)
- 分散トレース → OpenTelemetry + Cloud Trace
- 性能ボトルネック → Cloud Profiler
- 例外集約 → Error Reporting
- 外形 → Uptime Checks
- SLO → Cloud Monitoring SLO + Burn Rate Alert
- デプロイ → Blue-Green / Canary / Feature Flag
- 承認 → Cloud Deploy Approval
- GitOps → Config Sync / Argo CD
- ポリシー → Org Policy / Policy Controller
- 規制 → Assured Workloads
- 検証 → Load Test / Chaos / Pentest / Game Day
- AI 支援 → Gemini Cloud Assist Investigations
↓
要件の制約(ノイズ、コンプラ、コスト)を確認
↓
最も「症状ベース・SLO 駆動・自動化」志向の選択肢を選ぶ
⚡ 5 分で復習する箇条書きまとめ
- Observability 4 大柱: Cloud Monitoring / Logging / Trace / Profiler、+ Error Reporting、Uptime、Managed Prometheus
- SRE 用語: SLI(実測)/ SLO(内部目標)/ SLA(契約)/ エラーバジェット / Toil(50% 目標)/ Burn Rate
- アラート: 症状ベース、Multi-burn-rate (5min/14.4x, 1h/6x, 6h/1x)、Forecast 予測
- ログ: Sink(BigQuery/GCS/Pub/Sub)、Aggregated Sink(組織横断)、Log Analytics、Data Access は無効デフォルト
- トレース: OpenTelemetry が標準、Cloud Trace と統合
- デプロイ: Rolling / Blue-Green(即時切戻し) / Canary(段階) / Feature Flag / Approval
- GitOps: Config Sync / Argo CD / Flux
- ポリシー: Organization Policy(GCP)/ Policy Controller(K8s)/ Assured Workloads(規制)
- 信頼性検証: Load Test / Chaos Engineering(4 原則)/ Game Day / Pentest(GCP 事前申請不要)
- AI 支援: Gemini Cloud Assist Investigations / Log + Gemini / Alert 要約
- DORA: Deploy Frequency / Lead Time / CFR / MTTR
- Postmortem: Blameless、Five Whys、Runbook 化
試験前日はこのファイルを 3 回ループ + Section 1 / Section 5 の 03_要点と暗記.md を組合せて復習。