接下來三個練習中,你要整理 music_df 資料集。你會建立一個 pipeline 來插補遺漏值,並訓練一個 KNN 分類器模型,然後用它來預測某首歌是否屬於 "Rock" 曲風。
music_df
"Rock"
在這個練習中,你要刪除整體佔比少於 5% 的遺漏值,並把 "genre" 欄位轉換成二元特徵。
"genre"
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Print missing values for each column ____
本章將介紹分類問題,並學習如何用監督式學習技術來解題。你會學到如何將資料分成訓練集與測試集、擬合模型、進行預測,以及評估準確率。你也會了解模型複雜度與效能之間的關係,並把所學應用到顧客流失資料集上,為電信公司客戶分類其流失狀態。
本章將介紹迴歸,並使用廣告支出資料集建立模型來預測銷售額。你會學到線性迴歸的運作機制,以及常見的效能指標,如 R-squared 與均方根誤差。你也會進行 k 折交叉驗證,並在迴歸模型上套用正規化來降低過度擬合的風險。
在訓練好模型之後,接下來你將學習如何評估它們。本章會介紹多種評估指標,以及使用 scikit-learn 進行分類模型效能分析的視覺化技巧。你也會學到如何透過超參數調校來最佳化分類與迴歸模型。
學習如何補齊遺漏值、將類別資料轉換為數值、縮放資料、同時評估多個監督式學習模型,並建立管線來簡化你的工作流程!
當前練習