將資料切分為訓練與測試
在建立迴歸模型前的最後一步!在這裡,你會依序完成:找出目標變數與特徵欄位的名稱、擷取資料,並將其切分為訓練與測試。
pandas 與 numpy 函式庫已分別載入為 pd 與 np。輸入特徵已匯入為 features 資料集,而你在上一個練習建立的目標變數也已替你載入為 Y。
本練習屬於課程
Python 的行銷機器學習
練習說明
- 將客戶識別欄位名稱以清單形式儲存。
- 選取排除客戶識別欄位後的特徵欄位名稱。
- 將特徵擷取為
X。 - 使用
train_test_split()函式將資料切分為訓練與測試。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)