在建立任何模型之前,先將資料集分成兩部分很重要:訓練集用來建立流失(churn)模型,測試集用來驗證模型表現。你可以使用 sklearn.model_selection 中的 train_test_split() 函式來完成這件事。
sklearn.model_selection
train_test_split()
在這個練習中,你會動手建立訓練集與測試集。工作環境中已提供 telco DataFrame。
telco
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Import train_test_split
開始使用 pandas 探索 Telco Churn Dataset,計算摘要統計,並用 Seaborn 建立具吸引力的視覺化圖表。
在探索過資料之後,現在該進行前處理,為機器學習做好準備。學習前處理的原因、內容與方法,包括特徵選擇與特徵工程。
當資料完成前處理並可用於機器學習後,就來進行流失預測吧!學習如何在 Python 中使用 scikit-learn 建立監督式學習模型。
當前練習
學習如何透過超參數調校來提升模型效能,並更深入理解驅動客戶流失的因素,好帶回業務端應用。