开始使用免费开始使用

数据编码

对分类数据进行编码,可以让其可用于机器学习算法。 R 会在内部对因子进行编码,但当您开发自己的模型时,仍需要进行编码。

在本练习中,您将先使用 lm() 构建一个线性模型,然后一步步开发您自己的模型。

独热编码中,每个水平都会创建一个单独的列。

请注意,其中一列可以由其他列推导得到(例如,列 "B" 和 "C" 中为 0 就意味着列 "A" 中为 1)。 因此,在进行线性回归时,您可以丢弃第一列。 我们将在下一章更详细地回顾线性模型。

对于独热编码,您可以使用 caret 包中的 dummyVars()

使用方法是先创建编码器,然后再转换数据集:

encoder <- dummyVars(~ category, data = df)
predict(encoder, newdata = df)

MASS 包中的问卷调查数据集的完整观测可作为 survey 使用。 caret 包已预加载。

本练习是课程的一部分

R 统计面试题实战练习

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Fit a linear model
lm(___ ~ Exer, data = ___)
编辑并运行代码