机器学习模型的结构
现在,您将加深对数据如何影响模型性能的理解。您将使用 Airbnb 预订数据集(文件 booking.csv)。该数据集适合用于分类任务,以预测用户是否会取消预订。它包含多列数值型和分类型特征。
您将使用 split_dataset.py 脚本把提供的数据集划分为三个互不重叠的样本——train_A.csv、train_B.csv 和 test.csv。随后,针对每个训练数据集,您将运行数据处理与模型训练流水线,训练一个随机森林分类器,并使用 model_training.py 在测试集上评估其性能。params.json 中定义的超参数在两次运行中保持一致。
这些 Python 脚本支持命令行参数,并可通过 shell 运行。建议您查看这些脚本,以加深理解。
本练习是课程的一部分
