您的第一个 TfIdf
在本练习中,您将把 TfIdf 方法应用到一个小型 annak 数据集上,其中包含列夫·托尔斯泰《安娜·卡列尼娜》第一句话。
您的任务是使用该数据集并应用 TfidfVectorizer() 函数。回顾一下,将文本数值化是理解文本情感的第一步。Tfidf 向量化器是从情感列构建词汇表的另一种方法。
本练习是课程的一部分
Python 中的情感分析
练习说明
- 从
sklearn.feature_extraction.text导入用于构建 TfIdf 向量化器的函数。 - 调用
TfidfVectorizer()函数,并在annak数据集上进行拟合。 - 对向量化器执行转换。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Call the vectorizer and fit it
anna_vect = ____.___(annak)
# Create the tfidf representation
anna_tfidf = anna_vect.____(annak)
# Print the result
print(anna_tfidf.toarray())