Стемминг испанских отзывов
Вы, возможно, помните, что в предыдущей главе мы использовали пакет для определения языка, чтобы классифицировать отзывы на продукты Amazon. В этом упражнении вы сначала определите языки в non_english_reviews. Отзывы написаны на разных языках, но вам нужно выбрать ТОЛЬКО те, что на испанском. Если вы забыли некоторые концепции, можете вернуться к видео об определении языка текста.
На втором шаге вы создадите токены слов из испанских отзывов и выполните их стемминг с помощью стеммера SnowBall для испанского языка. К сожалению, пакет определения языка работает не идеально. Поэтому иногда определённый язык может оказаться неверным.
Это упражнение является частью курса
Анализ тональности текста на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']