开始使用免费开始使用

识别类别不平衡

您正在专注于机器学习生命周期中至关重要的前期阶段:探索性数据分析EDA)。

EDA 能帮助您更好地理解 heart_disease_df 数据集的特性,包括各变量之间的关系,以及在开始训练模型之前可能需要处理的问题。理解特征中的类别分布——例如患者的性别——是 EDA 的关键环节。

当一个类别的样本数量明显多于另一个类别时,就会出现类别不平衡。这可能会在训练过程中带来偏差,使模型倾向于多数类。

本练习是课程的一部分

端到端机器学习

查看课程

练习说明

  • 打印 sex 列的类别分布。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Print the sex value counts of the heart disease dataset
print(____[____].____)
编辑并运行代码