开始使用免费开始使用

您的第一个 TfIdf

在本练习中,您将把 TfIdf 方法应用到一个小型 annak 数据集上,其中包含列夫·托尔斯泰《安娜·卡列尼娜》第一句话。

您的任务是使用该数据集并应用 TfidfVectorizer() 函数。回顾一下,将文本数值化是理解文本情感的第一步。Tfidf 向量化器是从情感列构建词汇表的另一种方法。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • sklearn.feature_extraction.text 导入用于构建 TfIdf 向量化器的函数。
  • 调用 TfidfVectorizer() 函数,并在 annak 数据集上进行拟合。
  • 对向量化器执行转换。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Call the vectorizer and fit it
anna_vect = ____.___(annak)

# Create the tfidf representation
anna_tfidf = anna_vect.____(annak)

# Print the result 
print(anna_tfidf.toarray())
编辑并运行代码