TOP
💡 邁向小一的第一步!給孩子一本「查得到自信」的專屬辭典,輕鬆跨越閱讀關卡!🚀
Python數據科學項目實戰(簡體書)
滿額折

Python數據科學項目實戰(簡體書)

商品資訊

人民幣定價:139 元
定價
:NT$ 834 元
優惠價
87726
領券後再享88折起
海外經銷商無庫存,到貨日平均30天至45天
下單可得紅利積點 :21 點
商品簡介
作者簡介
名人推薦
目次

商品簡介

● 網頁抓取 ● 使用聚類算法組織數據集 ● 可視化複雜的多變量數據集 ● 訓練決策樹機器學習算法

作者簡介

Leonard Apeltsin是Anomaly的數據科學主管。他的團隊應用高級分析來發現醫療保健欺詐、浪費和濫用的情況。在加盟Anomaly之前,Leonard領導了Primer AI的機器學習開發工作;Primer AI是一家專門從事自然語言處理的初創公司。作為創始成員,Leonard幫助Primer AI團隊從4名員工發展到近100名員工。在進入創業公司之前,Leonard在學術界工作,他發現了遺傳相關疾病的隱藏模式。他的發現發表在《科學》和《自然》雜志的附屬期刊上。Leonard擁有卡內基梅隆大學的生物學和計算機科學學士學位,以及加州大學舊金山分校的生物信息學博士學位。

 

名人推薦

數據科學項目有很多靈活的部分,需要練習和技巧才能讓所有代碼、算法、數據集、格式和可視化協調工作。本書將引導你完成5個真實項目,包括根據新聞標題跟蹤疾病暴發、分析社交網絡以及在廣告點擊數據中尋找相關模式。
《Python數據科學項目實戰》並不止於表面理論和簡單示例。在完成每個項目時,你將學習如何解決常見問題,例如數據丟失、混亂的數據以及與構建模型不匹配的算法。你將了解詳細的設置說明和常見故障的全面解決方案。最後,通過完成這些項目,你將對自己的技能充滿信心。

開放式解決問題的能力對於數據科學職業至關重要。遺憾的是,這些能力不能僅通過閱讀獲得。要成為問題解決者,你必須堅持不懈地解決難題。考慮到這一點,我圍繞案例研究構思了本書:以現實世界情況為模型的開放式問題。案例研究範圍從在線廣告分析到使用新聞數據跟蹤疾病暴發。完成這些案例研究後,你將可以開始你的數據科學事業。
本書的目標讀者
本書的目標讀者是具有基本的分析基礎且有興趣轉行到數據科學職業的人。我的設想是,他也許是一位想探索更多的分析機會的經濟學大四學生,或者是一位已經畢業的化學專業學生正在尋找以數據為中心的職業道路。又或者,讀者可能是一位成功的前端Web開發人員,其數學背景非常有限,但也想嘗試數據科學。本書的潛在讀者都沒有上過數據科學課程,這讓他們在進行各種數據分析時感到力不從心。本書的目的是消除這些技能缺陷。
本書的讀者需要了解Python編程的最基本知識。自學Python入門知識的水平應該能足以探索本書中的練習。至於數學知識,讀者只需要理解基本的高中三角函數即可。
本書組織結構
本書包含5個難度由淺入深的案例研究。每個案例研究都以你需要解決的問題的詳細陳述開始。問題陳述之後是用2~5章介紹解決問題所需的數據科學技能。這些技能部分涵蓋了Python基礎庫以及數學和算法技術。每個案例研究的最後一章都描述了問題的解決方案。
案例研究1與基本概率論有關。
●第1章討論如何使用簡單的Python計算概率。
●第2章介紹概率分布的概念。該章還介紹Matplotlib可視化庫,通過它可以對分布進行可視化。
●第3章討論如何使用隨機模擬來估計概率。該章引入NumPy數值計算庫,從而促進有效的模擬執行。
●第4章包含案例研究的解決方案。
案例研究2從概率擴展到統計。
●第5章介紹中心性和離散性的簡單統計測量。該章還介紹SciPy科學計算庫,其中包含一個有用的統計模塊。
●第6章深入探討可用於進行統計預測的中心極限定理。
●第7章討論各種統計推斷技術,這些技術可用於將有趣的數據模式與隨機噪聲區分開。此外,該章說明了錯誤使用推理的危險以及如何更好地避免這些危險發生。
●第8章介紹Pandas庫,可用於在統計分析之前對表格數據進行預處理。
●第9章包含案例研究的解決方案。
案例研究3側重於介紹地理數據的無監督聚類。
●第10章介紹如何使用中心性度量將數據聚類到組中。該章還引入scikit-learn庫以促進高效聚類。
●第11章側重於介紹地理數據提取和可視化。在該章中,使用GeoNamesCache庫從文本中進行提取並使用Cartopy地圖繪製庫實現可視化。
●第12章包含案例研究的解決方案。
案例研究4側重於介紹使用大規模數值計算的自然語言處理。
●第13章說明如何使用矩陣乘法有效地計算文本之間的相似度。NumPy的內置矩陣優化被廣泛用於此目的。
●第14章展示如何利用降維來進行更有效的矩陣分析。該章結合scikit-learn的降維方法討論數學理論。
●第15章將自然語言處理技術應用於超大文本數據集。該章討論如何更好地探索和聚類這類文本數據。
●第16章展示如何使用Beautiful Soup HTML解析庫從在線數據中提取文本。
●第17章包含案例研究的解決方案。
案例研究5側重於對網絡理論和監督機器學習的討論。
●第18章結合NetworkX圖分析庫介紹基本網絡理論。
●第19章展示如何利用網絡流在網絡數據中尋找聚類。該章將概率模擬和矩陣乘法用於實現有效的聚類。
●第20章介紹一種基於網絡理論的簡單監督機器學習算法。該章還使用scikit-learn說明常見的機器學習評估技術。
●第21章討論其他機器學習技術,這些技術依賴內存高效的線性分類器。
●第22章深入探討之前介紹的監督學習方法的缺陷。隨後使用非線性決策樹分類器來規避這些缺陷。
●第23章包含案例研究的解決方案。
本書的每一章都建立在前幾章中介紹的算法和庫的基礎上。因此,我們鼓勵你從頭到尾閱讀本書,以減少困惑。但如果你已經熟悉書中的某些內容,可直接跳過它們。最後,強烈建議你在閱讀解決方案之前自己解決每個案例研究的問題。獨立解決每一個問題將使本書的價值最大化。
另外,讀者可掃描封底二維碼,來下載源代碼。

目次

案例研究1 在紙牌遊戲中尋找制勝策略
第1章 使用Python計算概率 3
1.1 樣本空間分析:一種用於測量結果不確定性的無方程方法 3
1.2 計算非平凡概率 7
1.2.1 問題1:分析一個有4個孩子的家庭 7
1.2.2 問題2:分析擲骰子遊戲 9
1.2.3 問題3:使用加權樣本空間計算擲骰概率 10
1.3 計算區間範圍內的概率 12
1.4 本章小結 14
第2章 使用Matplotlib繪製概率圖 15
2.1 基本的Matplotlib圖 15
2.2 繪製拋硬幣概率 19
2.3 本章小結 28
第3章 在NumPy中運行隨機模擬 29
3.1 使用NumPy模擬隨機拋硬幣和擲骰子實驗 29
3.2 使用直方圖和NumPy數組計算置信區間 33
3.2.1 通過直方圖合並顯示鄰近值 35
3.2.2 利用直方圖進行概率推導 38
3.2.3 縮小較高置信區間的範圍 40
3.2.4 在NumPy中計算直方圖 43
3.3 使用置信區間分析一副有偏紙牌 44
3.4 使用排列來洗牌 47
3.5 本章小結 49
第4章 案例研究1的解決方案 51
4.1 對紅牌進行預測 51
4.2 使用10張牌的樣本空間來優化策略 57
4.3 本章小結 61
案例研究2 評估在線廣告點擊的顯著性
第5章 使用SciPy進行基本概率和統計分析 65
5.1 使用SciPy探索數據和概率之間的關係 66
5.2 將均值作為中心性的度量 69
5.3 將方差作為離散性的度量 78
5.4 本章小結 83
第6章 使用中心極限定理和SciPy進行預測 85
6.1 使用SciPy處理正態分布 85
6.2 通過隨機采樣確定總體的均值和方差 92
6.3 使用均值和方差進行預測 95
6.3.1 計算正態曲線下方的面積 97
6.3.2 對計算的概率進行解釋 99
6.4 本章小結 100
第7章 統計假設檢驗 101
7.1 評估樣本均值和總體均值之間的差異 102
7.2 數據捕撈:過采樣將導致錯誤的結論 106
7.3 有放回的自舉法:當總體方差未知時檢驗假設 109
7.4 置換檢驗:當總體參數未知時比較樣本的均值 115
7.5 本章小結 118
第8章 使用Pandas分析表格 119
8.1 使用基本Python存儲表格 119
8.2 使用Pandas探索表格 120
8.3 檢索表中的列 122
8.4 檢索表中的行 124
8.5 修改表格行和列 126
8.6 保存和加載表格數據 129
8.7 使用Seaborn對表格進行可視化 130
8.8 本章小結 133
第9章 案例研究2的解決方案 135
9.1 在Pandas中處理廣告點擊數據表 135
9.2 根據均值差異計算p值 138
9.3 確定統計顯著性 140
9.4 一個真實的警世故事 142
9.5 本章小結 142
案例研究3 利用新聞標題跟蹤疾病暴發
第10章 對數據進行聚類 145
10.1 使用中心性發現聚類 145
10.2 K-means:一種將數據分組為K個中心組的聚類算法 151
10.2.1 使用scikit-learn進行K-means聚類 152
10.2.2 使用肘部法選擇最佳K值 154
10.3 使用密度發現聚類 158
10.4 DBSCAN:一種基於空間密度
對數據進行分組的聚類算法 161
10.4.1 比較DBSCAN和K-means 162
10.4.2 基於非歐幾裡得距離的聚類方法 163
10.5 使用Pandas分析聚類 166
10.6 本章小結 168
第11章 對地理位置進行可視化與分析 169
11.1 大圓距離:計算地球上兩點間的距離 170
11.2 使用Cartopy繪製地圖 172
11.2.1 手動安裝GEOS和Cartopy 173
11.2.2 使用Conda包管理器 173
11.2.3 可視化地圖 174
11.3 使用GeoNamesCache進行位置跟蹤 182
11.3.1 獲取國家/地區信息 184
11.3.2 獲取城市信息 186
11.3.3 GeoNamesCache庫的使用限制 189
11.4 在文本中匹配位置名稱 191
11.5 本章小結 194
第12章 案例研究3的解決方案 197
12.1 從標題數據中提取位置信息 197
12.2 對提取的位置信息進行可視化和聚類 203
12.3 對位置聚類進行分析 208
12.4 本章小結 213
案例研究4 使用在線招聘信息優化簡歷
第13章 測量文本相似度 217
13.1 簡單的文本比較 218
13.1.1 探索Jaccard相似度 222
13.1.2 用數值替換單詞 224
13.2 使用字數對文本進行向量化 228
13.2.1 使用歸一化提高TF向量相似度 230
13.2.2 使用單位向量點積在相關性指標之間進行轉換 237
13.3 使用矩陣乘法提高相似度計算的效率 239
13.3.1 基本矩陣運算 241
13.3.2 計算全矩陣相似度 249
13.4 矩陣乘法的計算限制 250
13.5 本章小結 253
第14章 矩陣數據的降維 255
14.1 將二維數據聚類到一維中 256
14.2 使用PCA和scikit-learn降維 269
14.3 將四維數據在二維中進行聚類 274
14.4 在不旋轉的情況下計算主成分 281
14.5 使用SVD和scikit-learn進行高效降維 292
14.6 本章小結 294
第15章 大型文本數據集的NLP分析 295
15.1 使用scikit-learn加載在線論壇討論數據 296
15.2 使用scikit-learn對文檔進行向量化 297
15.3 根據發布頻率和出現次數對單詞進行排名 304
15.4 計算大型文檔數據集之間的相似度 311
15.5 按主題對文本進行聚類 315
15.6 對文本聚類進行可視化 323
15.7 本章小結 333
第16章 從網頁中提取文本 335
16.1 HTML文檔的結構 335
16.2 使用Beautiful Soup解析HTML 342
16.3 下載和解析在線數據 349
16.4 本章小結 351
第17章 案例研究4的解決方案 353
17.1 從職位發布數據中提取技能要求 353
17.2 根據相關性對工作進行過濾 360
17.3 在相關職位發布中對技能進行聚類 369
17.3.1 將工作技能分成15個聚類 372
17.3.2 詳細分析技術技能聚類 377
17.3.3 詳細分析軟技能聚類 380
17.3.4 使用不同的K值來探索聚類 381
17.3.5 分析700個最相關的職位發布信息 385
17.4 結論 388
17.5 本章小結 388
案例研究5 利用社交網絡數據發現新朋友
第18章 圖論和網絡分析 393
18.1 使用基本圖論按受歡迎程度對網站進行排名 393
18.2 利用無向圖優化城鎮之間的旅行時間 404
18.2.1 建立一個複雜的城鎮交通網絡模型 406
18.2.2 計算節點之間的最快旅行時間 411
18.3 本章小結 418
第19章 用於節點排名和社交網絡分析的動態圖論技術 419
19.1 根據網絡中的預期流量發現中心節點 419
19.2 使用矩陣乘法計算交通概率 424
19.2.1 從概率論推導PageRank中心性 427
19.2.2 使用NetworkX計算PageRank中心性 431
19.3 使用馬爾可夫聚類進行社區檢測 433
19.4 在社交網絡中發現朋友群 445
19.5 本章小結 448
第20章 網絡驅動的監督機器學習 451
20.1 監督機器學習的基礎 451
20.2 測量預測的標簽的準確度 459
20.3 優化KNN性能 468
20.4 使用scikit-learn進行網格搜索 469
20.5 KNN算法的局限性 474
20.6 本章小結 475
第21章 使用邏輯回歸訓練線性分類器 477
21.1 根據身材尺寸對客戶進行線性劃分 477
21.2 訓練線性分類器 482
21.3 使用邏輯回歸改進線性分類 492
21.4 使用scikit-learn訓練線性分類器 499
21.5 通過系數測量特徵的重要性 504
21.6 線性分類器的限制 507
21.7 本章小結 508
第22章 通過決策樹技術訓練非線性分類器 511
22.1 邏輯規則的自動學習 511
22.1.1 使用兩個特徵訓練一個嵌套的if/else模型 517
22.1.2 決定拆分哪個特徵 523
22.1.3 訓練具有兩個以上特徵的if/else模型 530
22.2 使用scikit-learn訓練決策樹分類器 536
22.3 決策樹分類器的局限性 545
22.4 使用隨機森林分類提高模型性能 546
22.5 使用scikit-learn訓練隨機森林分類器 550
22.6 本章小結 551
第23章 案例研究5的解決方案 553
23.1 探索數據 553
23.1.1 檢查Profiles表 554
23.1.2 探索Observations表 556
23.1.3 探索Friendships表 559
23.2 使用網絡特徵訓練預測模型 562
23.3 向模型中添加個人資料特徵 568
23.4 通過一組穩定的特徵優化模型性能 572
23.5 解釋訓練模型 574
23.6 本章小結 578
 

 

購物須知

大陸出版品因裝訂品質及貨運條件與台灣出版品落差甚大,除封面破損、內頁脫落等較嚴重的狀態,其餘商品將正常出貨。

特別提醒:部分書籍附贈之內容(如音頻mp3或影片dvd等)已無實體光碟提供,需以QR CODE 連結至當地網站註冊“並通過驗證程序”,方可下載使用。

無現貨庫存之簡體書,將向海外調貨:
海外有庫存之書籍,等候約45個工作天;
海外無庫存之書籍,平均作業時間約60個工作天,然不保證確定可調到貨,尚請見諒。

為了保護您的權益,「三民網路書店」提供會員七日商品鑑賞期(收到商品為起始日)。

若要辦理退貨,請在商品鑑賞期內寄回,且商品必須是全新狀態與完整包裝(商品、附件、發票、隨貨贈品等)否則恕不接受退貨。

優惠價:87 726
海外經銷商無庫存,到貨日平均30天至45天

暢銷榜

客服中心

收藏

會員專區