开始使用免费开始使用

转换未见过的数据

从文本创建向量时,任何在训练机器学习模型前执行的转换,也需要同样应用到新的、未见过的(测试)数据上。要做到这一点,请遵循上一章相同的方法:仅在训练数据上拟合 vectorizer,并将其应用到测试数据。

在本练习中,speech_df DataFrame 已被拆分为两部分:

  • train_speech_df:训练集,包含前 45 篇演讲。
  • test_speech_df:测试集,包含其余的演讲。

本练习是课程的一部分

Python 中的机器学习特征工程

查看课程

练习说明

  • 实例化 TfidfVectorizer
  • 拟合该 vectorizer,并将其应用到 text_clean 列。
  • 在测试数据的 text_clean 列上应用相同的 vectorizer。
  • 使用测试集中的这些新特征创建一个 DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
编辑并运行代码