在构建预测模型时,您通常会分别有训练集和测试集的 DataFrame。此时,需要确保测试集中的信息不会泄漏到训练集中。对于要在这种情形下使用的数据进行缺失值填补时,您应该如何处理这两个数据集?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
本章将带您了解什么是特征工程,以及如何将其应用于真实世界数据。您将加载、探索并可视化一个问卷调查响应数据集,由此学习其底层数据类型,以及这些类型为何会影响您的特征工程方式。您将使用 pandas 库从分类列与连续列中创建新特征。
本章将介绍脏数据与不完整数据的现实情况。您将学习如何定位数据中的缺失值,并探索多种处理方法。您还将使用字符串处理技术,清理数据集中不需要的字符。
当前练习
本章将重点分析数据的底层分布,以及其是否会影响您的机器学习流程。您将学习如何处理偏态数据,以及在离群值可能对分析产生负面影响的情况下应对这些问题。
最后,在本章中,您将处理非结构化文本数据,学习如何从语料中工程化生成列式特征。您将比较不同方法对文本上下文提取量的影响,并学习在保留足够上下文与避免生成过多特征之间取得平衡。