商品簡介
內容簡介
這是一本將數據科學三要素――商業理解、量化模型、數據技術全面打通的實戰性著作,是來自騰訊、滴滴、快手等一線互聯網企業的數據科學家、數據分析師和算法工程師的經驗總結,得到了SQLFlow創始人以及騰訊、網易、快手、貝殼找房、穀歌等企業的專家一致好評和推薦。
全書三個部分,內容相對獨立,既能幫助初學者建立知識體系,又能幫助從業者解決商業中的實際問題,還能幫助有經驗的專家快速掌握數據科學的Z新技術和發展動向。內容圍繞非實驗環境下的觀測數據的分析、實驗的設計和分析、自助式數據科學平臺3大主題展開,涉及統計學、經濟學、機器學習、實驗科學等多個領域,包含大量常用的數據科學方法、簡潔的代碼實現和經典的實戰案例。
第1部分(第 1~6 章) 觀測數據的分析技術
講解了非實驗環境下不同觀測數據分析場景所對應的分析框架、原理及實際操作,包括消費者選擇偏好分析、消費者在時間維度上的行為分析、基於機器學習的用戶生命週期價值預測、基於可解釋模型技術的商業場景挖掘、基於矩陣分解技術的用戶行為規律發現與挖掘,以及在不能進行實驗分析時如何更科學地進行全量評估等內容。
第二部分(第7~9章)實驗設計和分析技術
從 A/B 實驗的基本原理出發,深入淺出地介紹了各種商業場景下進行實驗設計需要參考的原則和運用的方法,尤其是在有樣本量約束條件下提升實驗效能的方法及商業場景限制導致的非傳統實驗設計。
第三部分(第10~12章) 自助式數據科學平臺SQLFlow
針對性的講解了開源的工程化的自助式數據科學平臺SQLFlow,並通過系統配置、黑盒模型的解讀器應用、聚類分析場景等案例幫助讀者快速瞭解這一面向未來的數據科學技術。
名人推薦
騰訊、滴滴、快手數據科學家撰寫,打通商業理解、量化模型、數據技術3要素,騰訊、網易、快手、谷歌專家薦
目次
第1章:如何分析用戶的選擇 1
1.1選擇行為的經濟學理論 1
1.1.1 選擇無處不在 1
1.1.2 選擇行為的經濟學理論 2
1.2 用戶選擇行為計量分析框架:DCM 4
1.2.1 從經濟模型到計量模型 4
1.2.2 常用的DCM模型及應用場景 8
1.3 DCM模型的Python實踐 11
1.3.1?軟件包?&?數據格式 11
1.3.2 使用Logistics Regression分析自駕選擇問題 15
1.3.3 使用 Multinomial Logit Model 分析完整交通方式選擇問題 21
1.3.4 使用 Nested Logit Model 分析完整交通方式選擇問題 25
1.4 本章小節 27
第二章:隨時間可變的行為分析 27
2.1 從“如何給二手車定價”案例說起 27
2.1.1 二手車定價背景 27
2.1.2 為什麼不選擇一般回歸模型? 28
2.1.3 為什麼選擇生存分析? 29
2.2 生存分析的理論框架 29
2.2.2 生存函數及風險函數刻畫 34
2.2.3 生存函數回歸及生存概率的預測 36
2.3 生存分析在二手車定價案例中的應用實踐 38
2.3.1 軟件包&數據格式&數據入讀 40
2.3.2 生存分析基礎操作:二手車銷售生存曲線繪製及差異對比 42
第三章 洞察消費者長期價值:基於神經網絡的LTV建模 44
3.1 LTV的概念和商業應用 44
3.1.1 LTV――用戶終生(長期)價值 45
3.1.2 用戶生命週期和用戶終生價值 45
3.1.3 LTV的特點 46
3.1.4 LTV分析能幫助我們回答的問題 46
3.1.5 LTV的計算方法 47
3.2 神經網絡的基本原理 49
3.2.1 神經網絡的歷史 49
3.2.2 本章所涉及的神經網絡結構 50
3.3 基於Keras的LTV模型實踐 56
3.3.1 Keras介紹 56
3.3.2 數據的加載和預處理 56
3.3.3 輸入數據的準備 59
3.3.4 模型搭建和訓練 65
3.3.5 模型分析 68
3.4 本章總結 68
第4章 使用體系化分析方法進行場景挖掘 69
4.1. 選擇經驗化分析還是體系化分析 69
4.1.1經驗化分析的局限性 69
4.1.2體系化方法的手段和優勢 70
4.2. 體系化分析常用工具 71
4.2.1黑盒模型與白盒模型 71
4.2.2可解釋模型――決策樹 71
4.2.3全域代理模型 76
4.2.4場景挖掘模型分析方法框架 77
4.3. 場景挖掘分析實踐 78
4.3.1數據背景及數據處理 78
4.3.2經驗化分析 80
4.3.3場景挖掘模型的Python實現與模型解讀 80
4.4. 本章小結 86
第5章 行為規律的發現與挖掘 86
概述 86
5.1對包含有順序關係數據的規律分析 87
5.1.1有序數據及SVD方法概述 87
5.1.2SVD原理及推導 88
5.1.3SVD聚類建模Python實戰 93
5.2對無序稀疏數據的規律分析 98
5.2.1稀疏數據及NMF方法概述 98
5.2.2NMF原理及推導 99
5.2.3NMF聚類建模Python實戰 100
第6章 對觀測到的事件進行因果推斷 104
6.1 使用全量評估分析已發生的事件 104
6.1.1 為什麼要進行全量評估 104
6.1.2 全量評估應用 105
6.2 全量評估主要方法 105
6.2.1 回歸分析 105
6.2.2 DID方法 114
6.2.3 合成控制 116
6.2.4 Causal Impact 119
6.3 全量評估方法的應用 123
6.3.1 關於物流單量的全量評估應用(回歸模型) 123
6.3.2 恐怖主義對經濟影響評估(DID) 128
6.3.3 恐怖主義對經濟影響評估(合成控制) 130
6.3.4 天氣情況的評估(Causal Impact) 133
6.4 本章小結 147
第7章 如何比較兩個策略的效果 147
7.1如何才能正確推斷因果關係? 147
7.1.1 什麼是相關性謬誤 147
7.1.2 潛在結果和因果效果 148
7.2運用A/B實驗進行兩策略比較 149
7.2.1 什麼是A/B實驗 149
7.2.2 為什麼應用A/B實驗 150
7.2.3 A/B實驗的基本原理 150
7.3 A/B實驗應用步驟(實驗方法具體實施步驟) 151
7.3.1 明確實驗要素 151
7.3.2 實驗設計 153
7.3.3實驗過程監控 155
7.4 A/B實驗案例介紹 156
7.4.1 實驗場景介紹 156
7.4.3實驗效果評估 158
7.5 本章小結 159
第8章 如何提高實驗效能 160
8.1 控制實驗指標方差的必要性和手段 160
8.2 用隨機區組設計控制實驗指標方差 161
8.2.1 利用隨機區組實驗實驗設計降低方差 161
8.2.2 隨機區組實驗的特徵選擇 162
8.3 隨機區組實驗應用步驟 163
8.3.1 明確實驗目標及背景: 163
8.3.2 實驗設計: 163
8.3.3 實驗過程監控: 163
8.3.4 實驗評估中用到的方差分析的基本原理: 163
8.4 隨機區組實驗案例介紹 168
8.4.1 背景介紹: 168
8.4.2 基本設計: 169
8.4.3 隨機區組實驗相關的設計: 169
8.4.4 效果評估 170
8.5 隨機區組實驗常見問題 172
8.5.1 方差分析的使用前提是什麼 172
8.5.2 隨機區組的個數是越多越好嗎? 172
8.5.3 隨機區組實驗的回歸方程的$R^2$是越高越好嗎,是否證明策略有效果? 173
8.6 本章小節 173
第9章 特殊場景下的實驗設計和分析方法 173
9.1 分流的實驗對象間有干擾怎麼辦 174
9.2 如果實驗不能簡單分流怎麼辦(Switchback實驗設計和評估方法) 181
9.3 如果實驗不能簡單分流且時間效率要求高怎麼辦?(交叉實驗設計) 186
9.4 如果不能分流的實驗且策略不能輪轉怎麼辦? 199
9.5 本章總結 205
10.1 SQLFlow簡介 206
10.1.1 什麼是SQLFlow 206
10.1.2 SQLFlow的定位和目標 207
10.1.3 SQLFlow工作原理 209
10.2 SQLFLow 運行環境的設置 210
SQLFlow in Docker 210
環境配置 215
交互 224
Jupyter Notebook 225
REPL 225
10.3 將分析模型固化到 SQLFlow 中的流程 226
10.4 總結 232
11.1.1 模型可解釋的重要性和必要性 233
模型解釋的重要性 233
模型解釋的必要性 233
11.1.2 常見的可解釋性模型 234
(1)線性回歸 235
(2)邏輯回歸 238
(3) 決策樹 242
(4)KNN 243
(5)樸素貝葉斯分類器 245
(6)模型比較 246
11.2 黑盒模型的解釋性 247
11.2.1 如何對黑盒模型進行解釋 247
11.2.2 代理模型 248
11.2.3 Shapley 250
11.2.4 基於SQLFLow的黑盒模型解釋的案例 251
11.3 本章小結 255
第12章 基於LSTM-autoencoder的無監督聚類模型 255
12.1 聚類的廣泛應用 256
12.1.1 什麼是聚類或模式識別 256
12.2 聚類模型的應用案例 257
12.2.1 k-means clustering -- 司機服務站點選址規劃 257
12.2.2 Hierarchical Clustering -- 超市採購商分組 260
12.3 SQLFlow中基於深度學習的聚類模型 265
12.3.1 基於深度學習的聚類模型原理 265
12.3.2 Case study - 如何使用SQLFlow對城市道路交通狀況進行分層 272
12.4 本章小結 275