乳腺癌的逻辑回归
在上一个练习中,我们对数据做了初步评估。本练习中,您将为乳腺癌数据集上的逻辑回归模型定义训练集与测试集的划分。这是运行所有机器学习模型的重要第一步。
乳腺癌数据集是 sklearn 提供的示例数据集,包含来自患者的多种特征,目标值表示患者是否患有乳腺癌。数据以字典格式提供,主要数据存放在名为 data 的数组中,目标值存放在名为 target 的数组中。因此,cancer_data.data 是特征,cancer_data.target 是目标。示例数据已加载为 cancer_data,并且已将 pandas 以 pd 导入。LogisticRegression 可通过 sklearn.linear_model 使用。
本练习是课程的一部分
用 Python 预测 CTR 的机器学习实战
练习说明
- 分别使用
data和target定义X与y。 - 分别将
X与y的前 300 个样本作为X_train和y_train,例如X_train使用X[:300]。 - 分别将
X与y剩余的样本(不含前 300 个)作为X_test和y_test,例如X_test使用X[300:]。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]