重要用語集(フラッシュカード形式)
CDMP Fundamentals 試験対策 — 全14トピック
使い方
- 「用語」を見て定義・説明を答える
- 「説明」を見て用語を答える
- 週1回チェックし、自信のある項目に ✅ をつける
データ管理プロセス
| 用語 | 定義・説明 |
|---|---|
| DAMA | Data Management Association International。データ管理専門家の国際組織 |
| DMBOK | Data Management Body of Knowledge。DAMAが定義するデータ管理の知識体系書 |
| DAMA Wheel | DAMAのデータ管理フレームワーク。中心にData Governance、外周に10の知識領域 |
| DIKWピラミッド | Data → Information → Knowledge → Wisdom。データから知恵への変換モデル |
| 成熟度 Level 3 | Defined。プロセスが標準化・文書化されているが、定量的管理はない段階 |
| データライフサイクル | 計画→設計→作成→維持→強化→廃棄の6段階 |
データガバナンス
| 用語 | 定義・説明 |
|---|---|
| Data Governance | データ資産の管理に関する権限と制御の行使 |
| Data Steward | ビジネス側でデータドメインの説明責任を持つ役割 |
| Data Custodian | IT/技術側でデータを物理的に管理する役割 |
| CDO | Chief Data Officer。組織全体のデータ戦略を統括する最高責任者 |
| DGO | Data Governance Office。ガバナンス活動の日常的な調整・支援を行う事務局 |
| Data Governance Council | データ管理に関する戦略的意思決定を行う委員会(経営幹部レベル) |
| RACI | Responsible・Accountable・Consulted・Informed。責任分担マトリクス |
| Centralized モデル | ガバナンスを中央一元管理。一貫性高いが柔軟性低 |
| Federated モデル | 各部門が自律的に管理。柔軟だが一貫性確保が課題 |
| Hybrid モデル | 集中型と分散型の組み合わせ。最も一般的 |
| ガバナンス成功の最重要要因 | Executive Sponsorship(経営層のコミットメント) |
データアーキテクチャ
| 用語 | 定義・説明 |
|---|---|
| TOGAF | The Open Group Architecture Framework。最広用EAフレームワーク(4ドメイン:Business/Data/Application/Technology) |
| Zachman Framework | 6行×6列のマトリクスで企業アーキテクチャを整理するフレームワーク |
| EDM | Enterprise Data Model。組織全体の概念・論理データモデル |
| Data Lake | 生データを形式問わず格納。Schema-on-Read |
| Data Lakehouse | Data Lake + DWHの特性を統合したアーキテクチャ |
| Data Mesh | ドメイン分散型・データプロダクト指向のアーキテクチャ |
| Lambda Architecture | バッチレイヤー + スピードレイヤー + サービングレイヤーの統合 |
データモデリングと設計
| 用語 | 定義・説明 |
|---|---|
| 概念データモデル(CDM) | エンティティと関係のみ。ビジネス関係者向け |
| 論理データモデル(LDM) | 属性・データ型・正規化を含む。DBMS非依存 |
| 物理データモデル(PDM) | DBMS固有。テーブル・インデックス・制約を含む |
| 1NF | 繰り返しグループなし・すべての値が原子的 |
| 2NF | 1NF + 部分関数従属の除去 |
| 3NF | 2NF + 推移的関数従属の除去 |
| BCNF | 3NF + すべての決定子が候補キー |
| スタースキーマ | ファクトテーブル + 非正規化ディメンション |
| スノーフレークスキーマ | ファクトテーブル + 正規化ディメンション |
| SCD Type 1 | 上書き(履歴なし) |
| SCD Type 2 | 新行追加 + 有効日付(履歴完全保持) |
| SCD Type 3 | 旧値カラム追加(限定的履歴) |
| ナチュラルキー | ビジネス上の意味を持つ識別子 |
| サロゲートキー | システムが生成する意味のない一意識別子 |
| Forward Engineering | 要件→モデル→DDL の方向 |
| Reverse Engineering | 既存DB→モデル の方向 |
データストレージと運用
| 用語 | 定義・説明 |
|---|---|
| ACID | Atomicity・Consistency・Isolation・Durability。トランザクションの4特性 |
| Atomicity | 全部成功か全部失敗。中間状態なし |
| Consistency | トランザクション前後で整合性保持 |
| Isolation | 並行トランザクションの独立性 |
| Durability | コミット後のデータは永続 |
| CAP定理 | C(一貫性)+ A(可用性)+ P(分断耐性)の3つを同時には満たせない |
| RTO | Recovery Time Objective。障害から復旧するまでの目標時間 |
| RPO | Recovery Point Objective。失ってよいデータの最大量(時間で表現) |
| フルバックアップ | 全データのバックアップ |
| 増分バックアップ | 前回バックアップ以降の変更のみ |
| 差分バックアップ | フルバックアップ以降の全変更 |
データセキュリティ
| 用語 | 定義・説明 |
|---|---|
| CIAトライアド | Confidentiality(機密性)・Integrity(整合性)・Availability(可用性) |
| RBAC | Role-Based Access Control。役割ベースのアクセス制御(最も一般的) |
| ABAC | Attribute-Based Access Control。属性(部門・時間等)ベース |
| データマスキング | 本番データを偽データに置換(テスト環境用) |
| 匿名化 | 個人特定不可能に変換。不可逆 |
| 仮名化 | 識別子を仮名に変換。可逆。GDPRでも「個人データ」扱い |
| トークン化 | 機密データをトークンに置換(PCI DSS対応) |
| GDPR | EU一般データ保護規則。削除権(Right to be Forgotten)を含む |
| DPO | Data Protection Officer。GDPRで義務付けられたプライバシー責任者 |
| PCI DSS | クレジットカード情報の保護標準 |
| HIPAA | 米国の医療情報保護規制 |
データ統合と相互運用性
| 用語 | 定義・説明 |
|---|---|
| ETL | Extract→Transform→Load。変換後にロード |
| ELT | Extract→Load→Transform。ロード後にターゲットで変換(クラウド向け) |
| CDC | Change Data Capture。ソースの変更を検知して伝播 |
| ログベースCDC | DBトランザクションログを監視する手法(最も効率的) |
| ESB | Enterprise Service Bus。システム間のメッセージ仲介・変換 |
| データ仮想化 | データを物理的に移動させずに統合ビューを提供 |
| Hub-and-Spoke | 中央経由で接続。N本の接続で済む |
| Point-to-Point | 直接接続。N×(N-1)/2 本の接続が必要 |
| Publish-Subscribe | パブリッシャーがイベント発行、サブスクライバーが受信(非同期) |
ドキュメントとコンテンツ管理
| 用語 | 定義・説明 |
|---|---|
| ECM | Enterprise Content Management。非構造化データの総合管理 |
| レコード | 変更不可(Immutable)な法的証拠となる文書 |
| ドキュメント | 作業・協働用の更新可能な文書 |
| レコード保持スケジュール | 法規制に基づく保持期間の定義 |
| Dublin Core | コンテンツメタデータの標準(15要素) |
| DAM | Digital Asset Management。画像・動画等のデジタル資産管理 |
| 精度(Precision) | 検索結果中の関連文書の割合 |
| 再現率(Recall) | 全関連文書中の発見割合 |
| 非構造化データの割合 | 組織データの約80% |
参照データとマスターデータ管理
| 用語 | 定義・説明 |
|---|---|
| 参照データ | 分類・定義に使われるコード集。変化が極めて少ない(国コード等) |
| マスターデータ | ビジネス中核エンティティの基本情報(顧客・製品等) |
| MDM | Master Data Management。マスターデータの一貫性・正確性を管理 |
| Single Source of Truth | 組織全体で唯一の信頼できる情報源の確立 |
| ゴールデンレコード | 複数ソースを統合した最も正確な単一レコード |
| 名寄せ(Entity Resolution) | 同一エンティティの複数レコードを統合する処理 |
| ファジーマッチング | 類似度スコアによる名寄せ手法 |
| 生存ルール(Survivorship Rules) | マージ時にどの値を採用するかのルール |
| Registry型MDM | 各システムにポインタのみ保持。データは元システムに残る |
| Consolidation型MDM | 中央にマスター作成するが元システムへ配信しない(分析向け) |
| Coexistence型MDM | 中央でマスター作成後、各システムに配信 |
データウェアハウジングとBI
| 用語 | 定義・説明 |
|---|---|
| Inmon の4特性 | Subject-Oriented・Integrated・Non-Volatile・Time-Variant |
| Non-Volatile | データは追記のみ。削除・更新されない |
| Inmon アプローチ | Top-Down。EDWを先に構築→データマート。3NF採用 |
| Kimball アプローチ | Bottom-Up。データマートを先に構築。スタースキーマ採用 |
| OLTP | 業務処理最適化。正規化・高頻度更新 |
| OLAP | 分析最適化。非正規化・大量データ集計 |
| Staging Area | ETL前にソースデータを一時保管する領域 |
| ODS | Operational Data Store。リアルタイム統合データ(現在値) |
| コンフォームドディメンション | 複数データマートで共有されるディメンション |
| Descriptive Analytics | 過去に何が起きたか(レポート・ダッシュボード) |
| Diagnostic Analytics | なぜ起きたか(原因分析) |
| Predictive Analytics | 何が起きるか(機械学習・予測) |
| Prescriptive Analytics | 何をすべきか(最適化・推薦) |
メタデータ管理
| 用語 | 定義・説明 |
|---|---|
| メタデータ | データに関するデータ(Data about Data) |
| ビジネスメタデータ | 用語定義・ビジネスルール・スチュワード情報 |
| 技術メタデータ | スキーマ・データ型・DDL・テーブル構造 |
| 運用メタデータ | ETLログ・最終更新日時・ジョブ実行履歴 |
| データリネージ | データの起源から利用までの流れ(系譜) |
| データカタログ | データ資産の発見・検索を支援するプラットフォーム |
| メタデータリポジトリ | メタデータを格納・管理する基盤 |
| Business Glossary | ビジネス用語の統一定義集 |
| Data Dictionary | データ要素の技術的な仕様書 |
| Impact Analysis | 変更が下流システム・レポートに与える影響の調査 |
| データプロビナンス | データの由来・起源情報 |
データ品質
| 用語 | 定義・説明 |
|---|---|
| Completeness | 完全性。必要な値が揃っているか |
| Accuracy | 正確性。現実世界と一致しているか(内容的正しさ) |
| Consistency | 一貫性。複数ソース間で矛盾がないか |
| Timeliness | 適時性。必要な時にデータが利用可能か |
| Validity | 妥当性。定義されたルール・形式に適合するか(形式的正しさ) |
| Uniqueness | 一意性。重複がないか |
| データプロファイリング | 既存データの特性・品質を統計的に分析するプロセス |
| データクレンジング | 品質問題のあるデータを修正・標準化するプロセス |
| Deduplication | 重複レコードの統合・削除 |
| Enrichment | 外部データで欠損値を補完 |
| Prevention(予防) | 最もコスト効率の高い品質対策(入力段階のバリデーション) |
| 1:10:100の法則 | 入力時修正:開発時修正:本番後修正のコスト比 |
ビッグデータ
| 用語 | 定義・説明 |
|---|---|
| 4V | Volume・Velocity・Variety・Veracity(+Value) |
| Velocity | ビッグデータのV:生成・処理速度の高さ |
| Veracity | ビッグデータのV:データの信頼性・精度 |
| HDFS | Hadoop Distributed File System。Hadoopの分散ファイルシステム |
| Apache Spark | 高速分散処理エンジン。バッチ+ストリーム対応 |
| CRISP-DM | データサイエンスの標準プロセスモデル(6フェーズ) |
データ倫理
| 用語 | 定義・説明 |
|---|---|
| アルゴリズムバイアス | 学習データや設計の偏りによる不公平な結果 |
| インフォームドコンセント | 収集・利用の内容を理解した上でのデータ主体の同意 |
| 公正性(Fairness) | データ・AIが差別・偏見を生まないこと |
| 再識別化リスク | 匿名化データから個人が特定されるリスク |