对西班牙语评论做词干提取
您可能还记得,在前一章中我们使用过语言检测包来判断不同亚马逊商品评论的语言。在本练习中,您首先要检测 non_english_reviews 中每条评论的语言。评论包含多种语言,但您将只选择其中的西班牙语评论。如果忘记了一些概念,欢迎回看关于外语检测的视频。
第二步,您将从西班牙语评论中创建词语标记(tokens),并使用适用于西班牙语的 SnowBall 词干提取器对其进行词干化。 需要注意的是,语言检测包并不完美,因此有时检测到的语言可能不正确。
本练习是课程的一部分
Python 中的情感分析
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']