王曉華,計算機專業講師,長期講授面向物件程序設計、數據結構、Hadoop程序設計等研究生和本科生相關課程;主要研究方向為云計算、數據挖掘。曾主持和參與多項國家和省級科研課題,獨立科研項目獲省級成果認定,發表過多篇論文,擁有一項國家專利。著有《Spark MLlib機器學習實踐》《TensorFlow深度學習應用實踐》《OpenCV+TensorFlow深度學習與計算機視覺實戰》《TensorFlow 2.0卷積神經網絡實戰》《TensorFlow+Keras自然語言處理實戰》等圖書。
前 言
自動語音識別(Automatic Speech Recognition,ASR)簡稱為語音識別,是目前科學界、互聯網界和工業界研究的一大技術熱點及重點方向,也是很有前途和廣闊發展空間的一大新興技術領域。語音識別可以看成一種廣義的自然語言處理技術,目的是輔助人與人之間、人與機器之間更有效的交流。語音識別目前已經應用在人們生活中的各個方面,常用的有文字轉語音、語音轉文字等。
隨著深度學習在圖像處理中獲得成功,科研人員嘗試使用深度學習解決語音識別的問題,因為這兩個領域的相關特征信息都是相對低層次的,可以借助深度學習的強大學習能力學習其中的復雜信息,目前來看這個嘗試是成功的,深度學習同樣能夠幫助語音識別取得長足進步。
本書選用TensorFlow 2.1作為深度學習的框架,從TensorFlow 2的基礎語法開始,到使用TensorFlow 2進行深度學習語音識別程序的設計和實戰編寫,全面介紹使用TensorFlow 2進行語音識別實戰的核心技術及其相關知識,內容全面而翔實。
本書並不是一本簡單的實戰“例題”性圖書,本書在講解和演示實例代碼的過程中,對TensorFlow 2的核心內容進行深入分析,重要內容均結合代碼進行實戰講解,圍繞深度學習基本原理介紹了大量實戰案例,讀者通過這些案例可以深入地了解和掌握深度學習和TensorFlow 2的相關技術,並對使用深度學習進行語音識別進一步掌握。
本書是一本面向初級和中級讀者的優秀教程。通過本書的學習,讀者能夠掌握使用深度學習進行語音識別的基本技術和在TensorFlow 2框架下使用神經網絡的知識要點,掌握從基於深度學習的語音識別模型的構建到語音識別應用程序的編寫這一整套開發技巧。
本書特色
(
1)重實踐,講原理。本書立足於深度學習,以語音識別實戰為目的進行講解,提供了完整可運行的語音識別全套代碼,並對其基本原理進行講解,讀者可以直接將其應用到實際生產環境中。
(
2)版本新,易入門。本書詳細介紹TensorFlow 2的安裝及使用、默認API以及官方所推薦的Keras編程方法與技巧。
(
3)作者經驗豐富,代碼編寫細膩。作者是長期奮戰在科研和工業界的一線算法設計和程序編寫人員,實戰經驗豐富,對代碼中可能會出現的各種問題和“坑”有豐富的處理經驗,使得讀者能夠少走很多彎路。
(4)理論扎實,深入淺出。在代碼設計的基礎上,本書還深入淺出地介紹了深度學習需要掌握的一些基本理論知識,作者通過公式與圖示結合的方式對理論進行介紹,方便讀者快速理解。
(
5)對比多種應用方案,實戰案例豐富。本書采用了大量的實例,同時提供了一些實現同類功能的其他解決方案,覆蓋了使用TensorFlow 2進行深度學習開發的常用技術。
本書內容及知識體系
本書完整介紹使用TensorFlow 2.1進行語音識別的方法和一些進階教程,基於TensorFlow 2版本的新架構模式和框架進行講解,主要內容如下:
第1章詳細介紹TensorFlow 2版本的安裝方法以及對應的運行環境的安裝,通過一個例子驗證TensorFlow 2的安裝效果,並將其作為貫穿全書學習的主線。同時介紹了TensorFlow 2硬件的采購,記住一塊能夠運行TensorFlow 2 GPU版本的顯卡能讓你的學習和工作事半功倍。
第2章是本書的重點,從模型的設計開始,循序漸進地介紹TensorFlow 2的編程方法,包括結合Keras進行TensorFlow 2模型設計的完整步驟,以及自定義層的方法。本章內容看起來很簡單,卻是本書的基礎和核心精華,讀者一定要反復閱讀,認真掌握所有內容和代碼的編寫方法。
第3章是TensorFlow 2的理論部分,介紹反饋神經網絡的實現和兩個核心算法,通過圖示結合理論公式的方式詳細地介紹理論和原理,並手動實現了一個反饋神經網絡。
第4章詳細介紹卷積神經網絡的原理和各個模型的使用及自定義內容,講解借助卷積神經網絡算法構建一個簡單的CNN模型進行MNIST數字識別。
第5章是TensorFlow 2新版本的數據讀寫部分,詳細介紹使用TensorFlow 2自帶的Dataset API對數據進行序列化存儲,並通過簡單的想法對數據重新讀取,以及調用程序的方法。
第6章介紹ResNet的基本思想和內容,ResNet是一個具有裡程碑性質的框架,標志著粗獷的卷積神經網絡設計向著精確化和模塊化的方向轉化。ResNet本身的程序編寫非常簡單,但是其中蘊含的設計思想卻是跨越性的。
第7章主要介紹自然語言處理的一個基本架構——循環神經網絡進行語音識別的方法,這與第6章的內容互補,可以加深讀者對深度學習中不同模塊和架構的理解。
第8章主要介紹自然語言處理基本的詞嵌入的訓練和使用,從一個有趣的問題引導讀者從文本清洗開始,到詞嵌入的計算,以及利用文本的不同維度和角度對文本進行拆分。
第9章介紹更為細化的自然語言處理部分,總結和復習本書前面所學習的內容,並使用深度學習工具實現一個“解碼器”,從而解決拼音到文字的轉換。這一章的目的是對前期內容的總結,也為下一章語音識別的轉換部分打下基礎。
第10章是本書的最後一章,著重介紹語音識別的應用理論和實現方法,並帶領讀者完整地實現一個語音文字轉換的實戰案例。此實戰案例既可以作為學習示例使用,又可以作為實際應用的程序進行移植。
適合閱讀本書的讀者
? 語音識別初學者。
? 深度學習初學者。
? 機器學習初學者。
? 高等院校人工智能專業的師生。
? 專業培訓機構的學員。
? 其他對智能化、自動化感興趣的技術人員。
源碼、數據集、開發環境下載和技術支持
本書配套的資源請用微信掃描右邊的二維碼下載,也可按掃描出來的頁面填寫自己的郵箱,把鏈接轉發到郵箱中下載。如果學習本書的過程中發現問題,可發送郵件,郵件主題填寫“TensorFlow語音識別實戰”。
勘誤和鳴謝
由於筆者的水平有限,加之編寫時間跨度較長,同時TensorFlow版本演進較快,在編寫此書的過程中難免會出現不準確的地方,懇請讀者批評指正。
感謝所有編輯在本書編寫中提供的無私幫助和寶貴建議,正是他們的耐心和支持才讓本書得以順利出版。感謝家人對我的支持和理解,這些都給了我莫大的動力,讓我的努力更加有意義。
著 者
2021年5月
大陸出版品因裝訂品質及貨運條件與台灣出版品落差甚大,除封面破損、內頁脫落等較嚴重的狀態,其餘商品將正常出貨。
特別提醒:部分書籍附贈之內容(如音頻mp3或影片dvd等)已無實體光碟提供,需以QR CODE 連結至當地網站註冊“並通過驗證程序”,方可下載使用。
無現貨庫存之簡體書,將向海外調貨:
海外有庫存之書籍,等候約45個工作天;
海外無庫存之書籍,平均作業時間約60個工作天,然不保證確定可調到貨,尚請見諒。
為了保護您的權益,「三民網路書店」提供會員七日商品鑑賞期(收到商品為起始日)。
若要辦理退貨,請在商品鑑賞期內寄回,且商品必須是全新狀態與完整包裝(商品、附件、發票、隨貨贈品等)否則恕不接受退貨。