已為你預先載入名為 weird_df 的資料集,包含美國疾病管制與預防中心(CDC)與能源部提供的實際資料。
weird_df
來看看能不能找出一些規律。
Seaborn 已以 sns 載入,matplotlib.pyplot 已以 plt 載入。
sns
plt
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Print the first five lines of weird_df print(____.____)
你將認識降維的概念,並學會何時、為什麼需要降維。你會了解特徵選擇與特徵擷取的差異,並在資料探索中實作這兩種技術。章節最後會介紹 t-SNE,一種強大的特徵擷取技術,能幫你將高維度資料集可視化。
在特徵選擇的兩個章節之首,你會學到維度詛咒,以及降維如何幫助你克服它。你將認識多種技巧,用來偵測並移除對資料集幾乎沒有增益的特徵——可能因為變異很小、遺漏值太多,或與其他特徵高度相關。
當前練習
在特徵選擇的第二個章節,你將學會如何讓模型協助你找出對預測特定目標特徵最重要的那些特徵。在本章最後一課中,你會綜合多個不同模型的建議,來決定哪些特徵值得保留。
本章將深入探討最常用的降維演算法——主成分分析(PCA)。你會建立對此演算法的直覺理解,知道它為何強大,並在資料探索與建模流程的前處理中加以應用。最後,會以影像壓縮的有趣案例作結。