开始使用免费开始使用

乳腺癌的逻辑回归

在上一个练习中,我们对数据做了初步评估。本练习中,您将为乳腺癌数据集上的逻辑回归模型定义训练集与测试集的划分。这是运行所有机器学习模型的重要第一步。

乳腺癌数据集是 sklearn 提供的示例数据集,包含来自患者的多种特征,目标值表示患者是否患有乳腺癌。数据以字典格式提供,主要数据存放在名为 data 的数组中,目标值存放在名为 target 的数组中。因此,cancer_data.data 是特征,cancer_data.target 是目标。示例数据已加载为 cancer_data,并且已将 pandaspd 导入。LogisticRegression 可通过 sklearn.linear_model 使用。

本练习是课程的一部分

用 Python 预测 CTR 的机器学习实战

查看课程

练习说明

  • 分别使用 datatarget 定义 Xy
  • 分别将 Xy 的前 300 个样本作为 X_trainy_train,例如 X_train 使用 X[:300]
  • 分别将 Xy 剩余的样本(不含前 300 个)作为 X_testy_test,例如 X_test 使用 X[300:]

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Define X and y 
X = cancer_data.____
y = cancer_data.____

# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____] 
编辑并运行代码