开始使用免费开始使用

电影标语的 n-gram 模型

在本练习中,已为您提供一个包含 9,000 多条电影标语的 corpus。您的任务是为这份数据生成 n 分别等于 1、2、3 的 n-gram 模型,并找出每个模型的特征数量。

然后,我们将比较每个模型生成的特征数量。

本练习是课程的一部分

Python 中的 NLP 特征工程

查看课程

练习说明

  • 生成一个 n-gram 模型,n-gram 上限为 n=1。命名为 ng1
  • 生成一个 n-gram 模型,n-gram 上限为 n=2。命名为 ng2
  • 生成一个 n-gram 模型,n-gram 上限为 n=3。命名为 ng3
  • 打印每个模型的特征数量。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)

# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)

# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)

# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))
编辑并运行代码