or
本練習屬於課程
在本章中,你將探索什麼是特徵工程,以及如何開始將它應用到真實世界的資料。你會載入、探索並視覺化一個調查回覆資料集,並在此過程中學習其底層資料型別,以及這些型別為何會影響你應該如何設計特徵。你將使用 pandas 套件,從類別與連續欄位建立新的特徵。
本章將帶你面對凌亂且不完整的資料現實。你會學到如何找出資料中的遺漏值,並探索多種處理方式。你也會使用字串處理技巧,清除資料集中不需要的字元。
在本章中,你將著重於分析資料的底層分佈,並評估其是否會影響你的機器學習流程。你會學到如何處理偏態資料,以及在離群值可能對分析造成負面影響時該怎麼做。
最後,在本章中,你將處理非結構化文字資料,了解如何從文本語料中設計出欄位型特徵。你會比較不同作法如何影響可從文本擷取的脈絡量,並學會在保留足夠脈絡與避免產生過多特徵之間取得平衡。
當前練習