セクション6 要点と暗記 — AI ソリューションのモニタリング
🎯 暗記版。4種ドリフトの区別、Model Armor、Explainable AI、Gen AI 評価。
🌳 ドリフト種別判定ツリー
何が変化した?
├─ 訓練時と推論時で 前処理コードが違う → Training-Serving Skew
├─ 入力 X の分布が時間とともに変化 → Data Drift
├─ 入力と出力の関係 P(Y|X) が変化 → Concept Drift(要ラベル)
└─ 各特徴量の予測寄与度が変化 → Feature Attribution Drift 🆕
🌳 Explainable AI 手法選定
データタイプは?
├─ 表形式 → Sampled Shapley
├─ 画像(リージョン重要度) → XRAI
├─ 画像(ピクセル単位) → Integrated Gradients
└─ テキスト / 系列 → Integrated Gradients
🌳 LLM セキュリティ層
入力フィルタ:
Regex(単純パターン)
+ Sensitive Data Protection(PII 検出)
+ Model Armor(プロンプトインジェクション・ジェイルブレイク)
+ Safety Filters(Gemini 標準)
出力フィルタ:
Model Armor(出力中の機密漏洩・有害)
+ Sensitive Data Protection(PII 再スキャン)
+ Safety Filters
🃏 暗記カード
| Q | A |
|---|---|
| 4種類のドリフトは? | Training-Serving Skew / Data Drift / Concept Drift / Feature Attribution Drift |
| Data Drift と Concept Drift の違い | Data Drift = X の分布変化、Concept Drift = P(Y|X) 変化(ラベル必要) |
| 🆕 Feature Attribution Drift で見るもの | 各特徴量の モデルへの寄与度 の分布変化 |
| 訓練/推論の前処理ズレ対策 | TFT または Feature Store |
| 本番モデルのドリフト監視サービスは? | Agent Platform Model Monitoring |
| Explainable AI の表形式向け手法 | Sampled Shapley |
| Explainable AI の画像リージョン向け手法 | XRAI |
| Explainable AI の画像ピクセル向け手法 | Integrated Gradients |
| 🆕 LLM 向けセキュリティサービスは? | Model Armor |
| Model Armor で防げるもの | プロンプトインジェクション / ジェイルブレイク / PII 漏洩 / 有害コンテンツ / データ漏洩 |
| Gemini 標準のフィルタは? | Safety Filters |
| 構造化 PII 検出は? | Sensitive Data Protection (旧 DLP) |
| 🆕 生成 AI 評価のマネージドサービスは? | Gen AI Evaluation Service |
| 自動評価メトリクスの代表(翻訳/要約) | BLEU / ROUGE / METEOR / Perplexity |
| LLM-as-a-judge の典型バイアスは? | 順序効果・長文を高評価・自己評価バイアス |
| 公平性の指標2つ | Equalized Odds / Demographic Parity |
| Model Card と Data Card の役割 | モデル/データの目的・性能・限界を文書化(透明性) |
| 差分プライバシーの2パラメータ | (ε, δ) |
| 連合学習で送られるのは? | 勾配のみ(生データ非送信) |
| 機密計算の VM は? | Confidential VM |
| 観測の3層 | Cloud Monitoring(メトリクス)/ Cloud Logging(ログ)/ Model Monitoring(ML) |
📊 対比表
ドリフト4種
| Training-Serving Skew | Data Drift | Concept Drift | Feature Attribution Drift | |
|---|---|---|---|---|
| 変化対象 | 前処理コード | X の分布 | P(Y|X) | 特徴量寄与度 |
| ラベル必要? | × | × | ○ | × |
| 検知 | 即時 | 継続 | ラベル取得時 | 継続 |
| 対策 | TFT / Feature Store | 再訓練 | 再訓練+特徴見直し | 再訓練+特徴見直し |
Explainable AI 手法
| Sampled Shapley | Integrated Gradients | XRAI | |
|---|---|---|---|
| 主な対象 | 表形式 | DNN(画像/テキスト) | 画像 |
| 出力 | 特徴量ごとの貢献度 | ピクセル/トークンの貢献 | リージョンの貢献 |
| 計算量 | 中〜大 | 中 | 中 |
LLM セキュリティツール
| Regex | DLP | Safety Filters | Model Armor | |
|---|---|---|---|---|
| 検出種類 | パターン | PII | 有害コンテンツ | プロンプト攻撃含む包括 |
| マネージド | △ (自作) | ◎ | ◎ (Gemini 内蔵) | ◎ |
| LLM 特化 | × | × | ○ | ◎ |
| 第一候補 | 単純フィルタ | PII | 標準保護 | 包括的 LLM 防御 |
生成 AI 評価アプローチ
| 自動メトリクス | LLM-as-a-judge | 人手評価 | |
|---|---|---|---|
| コスト | 最低 | 中 | 最高 |
| 速度 | 即時 | 数秒/件 | 分〜時間 |
| 主観性 | 低 | 中 | 高 |
| マネージドサービス | – | Gen AI Evaluation Service | – |
🔥 頻出シナリオ → 即答パターン
| シナリオ | 即答 |
|---|---|
| 入力分布が変化 | Data Drift |
| 入力と出力関係が変化 | Concept Drift |
| 訓練/推論で前処理コードがずれる | Training-Serving Skew → TFT/Feature Store |
| 特徴量重要度が変化 | Feature Attribution Drift |
| 本番モデルのドリフト監視 | Agent Platform Model Monitoring |
| LLM プロンプトインジェクション対策 | Model Armor |
| LLM 出力に PII が混入する恐れ | Model Armor + DLP 後段スキャン |
| 構造化 PII の検出 | Sensitive Data Protection (DLP) |
| 生成 AI 品質の継続評価 | Gen AI Evaluation Service + LLM-as-a-judge |
| 表モデルの予測理由を説明 | Sampled Shapley |
| 画像分類の判断根拠 | Integrated Gradients / XRAI |
| 属性別精度差の検知 | TFMA / Model Evaluation のスライス評価 |
| ドリフト検知 → 自動再訓練 | Model Monitoring → Pub/Sub → Pipelines |
| プライバシー保証付き訓練 | Differential Privacy (TF Privacy) |
| 生データを集めず学習 | 連合学習 (Federated Learning) |
| メモリ内も暗号化で計算 | Confidential VM / Confidential GKE |
| 透明性のためのドキュメント | Model Card / Data Card |
| 公平性メトリクス | Equalized Odds / Demographic Parity |
⚠️ ひっかけ警報
- 「Data Drift と Concept Drift は同じ」 → 違う。Concept は P(Y|X) の変化、ラベル必要
- 「Concept Drift をラベルなしで検知できる」 → 真値が必要。プロキシで近似は可能
- 「LLM の安全対策は Safety Filters だけで十分」 → 包括防御は Model Armor で
- 「PII 検出は LLM 用にも DLP だけで OK」 → LLM 特有の脅威は Model Armor
- 「Sampled Shapley を画像分類に使う」 → 画像は Integrated Gradients / XRAI
- 「全体精度が高ければ公平性は OK」 → スライス別評価が必須
- 「サンプリングは 100% 必須」 → 高 QPS なら 5〜10% で十分
- 「ドリフト閾値はデフォルトでよい」 → ベースラインで再現性ある値に調整
- 「Model Cards は外部公開のみ」 → 内部向けにも透明性確保のため有効
- 「Cloud Composer の新名称は Cloud Workflows」 → Managed Service for Apache Airflow(Workflows は別物)
📝 一行サマリー
ドリフトは Skew / Data / Concept / Attribution の4種。本番監視は Model Monitoring、説明は Explainable AI(表は Shapley・画像は IG/XRAI)、LLM 防御は Model Armor、生成 AI 評価は Gen AI Evaluation Service。