开始使用免费开始使用

数据重采样

机器学习项目的第一步是创建用于拟合与评估的训练集和测试集。测试集可以估计模型在新数据上的表现,并有助于防止过拟合。

您将使用 telecom_df 数据集,其中包含一家电信公司的客户信息。目标变量是 canceled_service,记录客户是否取消了与公司的合约。自变量包含客户的手机与互联网使用情况、合约类型以及每月费用等信息。

telecom_df tibble 已加载到您的会话中。

本练习是课程的一部分

在 R 中使用 tidymodels 建模

查看课程

练习说明

  • 创建一个 rsample 对象 telecom_split,用于随机将 telecom_df 数据拆分为训练集和测试集。
    • 将 75% 的数据分配给训练集,并按 canceled_service 分层抽样。
  • telecom_split 对象传递给相应的 rsample 函数以创建训练集和测试集。
  • 将数据集传给 nrow() 函数,检查各自的行数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create data split object
telecom_split <- ___(___, prop = ___,
                     strata = ___)

# Create the training data
telecom_training <- ___ %>% 
  ___

# Create the test data
telecom_test <- ___ %>% 
  ___

# Check the number of rows
nrow(___)
nrow(___)
编辑并运行代码