●第1章 數據倉庫簡介
●1.1 什麼是數據倉庫 1
●1.1.1 數據倉庫的定義 1
●1.1.2 建立數據倉庫的原因 3
●1.2 操作型繫統與分析型繫統 5
●1.2.1 操作型繫統 5
●1.2.2 分析型繫統 8
●1.2.3 操作型繫統和分析型繫統對比 9
●1.3 數據倉庫架構 10
●1.3.1 基本架構 10
●1.3.2 主要數據倉庫架構 12
●1.3.3 操作數據存儲 16
●1.4 抽取-轉換-裝載 17
●1.4.1 數據抽取 17
●1.4.2 數據轉換 19
●1.4.3 數據裝載 20
●1.4.4 開發ETL繫統的方法 21
●1.4.5 常見ETL工具 21
●1.5 數據倉庫需求 22
●1.5.1 基本需求 22
●部分目錄
本書講述在流行的大數據分布式存儲和計算平臺Hadoop上設計實現數據倉庫,將傳統數據倉庫建模與SQL開發的簡單性與大數據技術相結合,快速、高效地建立可擴展的數據倉庫及其應用繫統。
本書內容包括數據倉庫、Hadoop及其生態圈的相關概念,使用Sqoop從關繫數據庫全量或增量抽取數據,使用HIVE進行數據轉換和裝載處理,使用Oozie調度作業周期性執行,使用Impala進行快速聯機數據分析,使用Hue將數據可視化,以及數據倉庫中的漸變維(SCD)、代理鍵、角色扮演維度、層次維度、退化維度、無事實的事實表、遲到的事實、累積的度量等常見問題在Hadoop上的處理等。
本書適合數據庫管理員、大數據技術人員、Hadoop技術人員、數據倉庫技術人員,也適合高等院校和培訓機構相關專業的師生教學參考。