03_要点と暗記

Section 6: 運用卓越性 — 🎯 要点と暗記

対象: 試験直前確認 / シニアの最終チェック。 目標: 1 セッション 20-30 分で全項目を高速ループ。


⚡ Cloud Observability 4 大柱 + α(即答)

サービス 役割
Cloud Monitoring メトリクス / Dashboards / Alert / Uptime / SLO
Cloud Logging ログ集約、Sink、Log-based Metrics、Log Analytics
Cloud Trace 分散トレース(OpenTelemetry 標準対応)
Cloud Profiler 本番常時プロファイリング(CPU/メモリ/Heap)
Error Reporting 例外集約、スタックトレース、影響範囲
Uptime Checks 外形監視(HTTP/HTTPS/TCP)
Managed Service for Prometheus PromQL 互換、自動スケール、24 ヶ月保持

⚡ SRE 用語(即答)

用語 内容
SLI 信頼性の 測定値(実測)
SLO 内部の 目標値
SLA 顧客との 契約値(罰則あり)
エラーバジェット 1 − SLO(許容できるダウン)
Toil 自動化可能な手作業(50% 以下を目標)
Burn Rate エラーバジェットの消費速度
DORA メトリクス Deploy Frequency / Lead Time / Change Failure Rate / MTTR

SLO 例の数値(暗記)

SLO 月あたりエラーバジェット
99% 7 時間 18 分
99.5% 3 時間 39 分
99.9% 43 分 12 秒
99.95% 21 分 36 秒
99.99% 4 分 19 秒
99.999% 25.9 秒

⚡ SLI のタイプ(即答)

タイプ
Availability HTTP 成功率
Latency p99 が 200ms 以下の割合
Error Rate 5xx エラー率
Throughput RPS / QPS
Saturation CPU / メモリ / Queue 使用率
Quality データ鮮度・正確さ

⚡ アラート戦略(即答)

観点 即答
良いアラート 症状ベース、アクション可能、SLO Burn Rate ベース
Multi-window/Multi-burn-rate Fast (5min/14.4x), Medium (1h/6x), Slow (6h/1x)
静的しきい値 アラート疲れの元、可能なら避ける
ノイズ削減 グループ化、Snooze、Notification Channel 振り分け
Forecast Alert 予測ベース(クォータ枯渇予知など)

Notification Channels の使い分け

Channel 用途
PagerDuty / Opsgenie Critical、夜間オンコール
Slack / Teams Warning、チーム共有
Email Notice、日次サマリー
Webhook ChatOps、カスタム
SMS / Voice 緊急時

⚡ Cloud Logging の重要事項(即答)

項目 内容
Sink 先 BigQuery / GCS / Pub/Sub / 別 Log Bucket / 外部 SIEM
Aggregated Sink 組織レベルで集約(コンプラ用)
Log Buckets _Default(30日)、_Required(400日、Audit用)
Log Analytics BigQuery で SQL 分析
Audit Logs 4 種 Admin Activity / Data Access(無効デフォルト) / System Event / Policy Denied

**「Data Access ログはデフォルト無効、コンプラなら明示有効化」**を必ず暗記。


⚡ デプロイ戦略(即答)

戦略 用途
Rolling Update 一般的
Blue-Green 即時切戻し
Canary 段階リリース
Recreate 全停止
Feature Flag コード変更なしで機能 ON/OFF
Progressive Delivery Canary + Flag + Observability
Cloud Deploy Approval 本番手前で承認

⚡ 信頼性検証(即答)

種類 代表ツール / 目的
Load Test Locust / k6 / JMeter(性能)
Chaos Engineering Chaos Toolkit / Litmus / Gremlin(回復力)
Game Day 障害想定演習
Pentest 侵入テスト(GCP は事前申請不要)
Spike Test 急増負荷
Soak Test 長時間負荷でのリーク
Endurance 24h+ 継続負荷

Chaos Engineering の 4 原則

1. 定常状態の仮説(SLO 達成)
2. 現実世界の事象を変数化
3. 本番(または近い環境)で実験
4. 自動化・継続実行

⚡ ポリシー / コンプラ(即答)

ツール 用途
Organization Policy GCP リソースの強制ポリシー
Policy Controller K8s リソースの強制(Gatekeeper)
Open Policy Agent (OPA) 汎用ポリシーエンジン
Security Command Center (SCC) 中央セキュリティ管理
Cloud Asset Inventory リソース棚卸し
Assured Workloads 規制業界(HIPAA / FedRAMP / IL4)
Config Sync GitOps(Anthos Config Management)

⚡ Gemini Cloud Assist for Observability(即答)

機能 用途
Investigations 障害時のリソース横断分析、原因仮説生成
Log Analytics + Gemini 自然言語でログ検索・要約
Alert Summarization 大量アラートを要約
Runbook 生成 過去対応からランブック自動生成

試験頻出: 「障害時に AI 支援」→ Gemini Cloud Assist Investigations


⚡ インシデント対応(即答)

ステップ 内容
1. 検知 Alert / Uptime Check / 顧客連絡
2. トリアージ 影響範囲・優先度
3. 暫定対応 ロールバック / トラフィック切替
4. 復旧 SLO 回復確認
5. 連絡 Status Page / ステークホルダー
6. Postmortem Blameless、Five Whys、再発防止策

ICS(Incident Command System)

役割 責任
IC 全体統率・決断
Communication Lead 連絡・Status Page
Operations Lead 修復作業
Scribe 記録
SME 技術専門家

⚡ DORA メトリクス(即答)

指標 内容 良い方向
Deployment Frequency デプロイ頻度 高い
Lead Time for Changes コミット→本番時間 短い
Change Failure Rate 変更失敗率 低い
MTTR 障害復旧時間 短い

DevOps 成熟度の標準指標」= DORA。


⚡ Operational Excellence の原則(即答)

1. 自動化              ─── Terraform / CI/CD / 自動修復
2. 観測可能性          ─── Monitoring / Logging / Trace / Profiler
3. 継続的改善          ─── Postmortem / DORA / SLO レビュー
4. チームの責任        ─── DevOps / SRE モデル
5. 計画されたリリース  ─── Cloud Deploy / Canary / Approval

⚡ 必殺フレーズ(即答)

状況 即答
「分散トレース標準」 OpenTelemetry + Cloud Trace
「OSS Prometheus 互換」 Managed Service for Prometheus
「本番でも軽量プロファイル」 Cloud Profiler
「ログ集約・組織横断」 Aggregated Sink → BigQuery
「ログを SQL 分析」 Log Analytics
「監査ログ(無効デフォルト)」 Data Access Audit Logs
「外形監視」 Uptime Checks
「障害予測」 Forecast-based Alert
「SLO Burn Rate 推奨」 Multi-window / Multi-burn-rate
「アラート疲労対策」 症状ベース + SLO + ノイズ削減
「即時切戻し」 Blue-Green
「段階リリース」 Canary
「コード変更なし切替」 Feature Flag
「コンプラ承認」 Cloud Deploy Approval
「K8s GitOps」 Config Sync / Argo CD
「ポリシー強制(GCP)」 Organization Policy
「ポリシー強制(K8s)」 Policy Controller (Gatekeeper)
「規制業界統制」 Assured Workloads
「障害訓練」 Game Day
「自発障害注入」 Chaos Engineering
「侵入テスト(事前申請)」 不要(規約遵守で可)
「AI 障害分析」 Gemini Cloud Assist Investigations
「DevOps 成熟度」 DORA メトリクス
「Postmortem の鉄則」 Blameless

⚡ 必ず暗記する数値・名前


⚡ サービスリネーム最新

旧名 新名
Stackdriver Cloud Operations / Cloud Observability
Stackdriver Monitoring Cloud Monitoring
Stackdriver Logging Cloud Logging
Workspaces Metrics Scope
Anthos Config Management Config Sync + Policy Controller

⚡ ケーススタディの定番解(Section 6 視点)

ケース 推奨運用
Altostrat Media Cloud Monitoring SLO / Cloud Trace / Canary デプロイ / Game Day
Cymbal Retail Multi-burn-rate Alert / Feature Flag / Chaos Engineering
EHR Healthcare Aggregated Sink + BigQuery / Assured Workloads / Data Access Logs 有効 / Pentest
KnightMotives Automotive Managed Prometheus / Forecast Alert / Cloud Deploy Approval

⚡ 試験中の判断フローチャート

質問を読む
  ↓
「運用・観測・信頼性」キーワード抽出
  - メトリクス → Cloud Monitoring
  - ログ → Cloud Logging(Sink / Log Analytics)
  - 分散トレース → OpenTelemetry + Cloud Trace
  - 性能ボトルネック → Cloud Profiler
  - 例外集約 → Error Reporting
  - 外形 → Uptime Checks
  - SLO → Cloud Monitoring SLO + Burn Rate Alert
  - デプロイ → Blue-Green / Canary / Feature Flag
  - 承認 → Cloud Deploy Approval
  - GitOps → Config Sync / Argo CD
  - ポリシー → Org Policy / Policy Controller
  - 規制 → Assured Workloads
  - 検証 → Load Test / Chaos / Pentest / Game Day
  - AI 支援 → Gemini Cloud Assist Investigations
  ↓
要件の制約(ノイズ、コンプラ、コスト)を確認
  ↓
最も「症状ベース・SLO 駆動・自動化」志向の選択肢を選ぶ

⚡ 5 分で復習する箇条書きまとめ


試験前日はこのファイルを 3 回ループ + Section 1 / Section 5 の 03_要点と暗記.md を組合せて復習。