乳癌的邏輯斯迴歸
在上一個練習中,我們先做了資料的初步評估。本練習中,你將為乳癌資料集上的邏輯斯迴歸模型定義訓練集與測試集的切分。這是執行所有機器學習模型前的重要第一步。
乳癌資料集是來自 sklearn 的範例資料集,包含病患的多個特徵,目標值為病患是否罹患乳癌。資料以字典格式提供,主要資料存於名為 data 的陣列,目標值存於名為 target 的陣列。因此,cancer_data.data 是特徵,cancer_data.target 是目標。範例資料已載入為 cancer_data,並將 pandas 載入為 pd。LogisticRegression 可由 sklearn.linear_model 取得。
本練習屬於課程
用 Python 透過機器學習預測 CTR
練習說明
- 分別使用
data與target定義X與y。 - 讓
X_train與y_train分別為X與y的前 300 筆樣本,X_train請使用X[:300]。 - 讓
X_test與y_test分別為X與y的其餘部分(不含前 300 筆樣本),X_test請使用X[300:]。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]