or
本练习是课程的一部分
原始数据并不总是最适合直接用于分析。本章开篇,您将初步了解如何变换与创建特征,以提升模型的性能与可解释性。
在本章中,您将学习到,除了手动变换特征之外,还可以利用 tidyverse 的工具以编程方式构造新变量。您将探索这种方法如何提升模型的可复现性,尤其适用于包含大量特征的数据集。
接下来,您将学习模型常常能从降维与从高维数据中提取特征中受益,包括将文本数据转换为数值、对分类数据进行编码,以及衡量变量的预测能力。您将探索的方法包括主成分分析、核主成分分析、从文本中提取数值、分类编码,以及变量重要性评分。
在课程收尾,您将学习特征工程与机器学习技术。您将首先关注在模型中使用全部可用特征所带来的问题,以及识别无关和冗余特征的重要性,并学习使用嵌入式方法(如 lasso 与 elastic-net)去除这些特征。随后,您将探索收缩方法,如 lasso、ridge 和 elastic-net,可用于正则化特征权重,或通过将系数设为 0 来进行特征选择。最后,您将学习如何构建端到端的特征工程工作流程,并在一个小型项目中回顾与练习前面学到的概念与函数。
当前练习