Стемінг іспаномовних відгуків
Згадайте, що в попередньому розділі ми використовували пакет для визначення мови, щоб встановити мову різних відгуків про товари на Amazon. У цій вправі ви спочатку визначите мови у non_english_reviews. Відгуки подано кількома мовами, але ви виберете ЛИШЕ ті, що іспанською. За потреби поверніться до відео про визначення іноземних мов, якщо забули деякі поняття.
На другому етапі ви створите токени слів з іспаномовних відгуків і застосуєте до них стемінг за допомогою стемера SnowBall для іспанської мови. Пакет для визначення мови, на жаль, не ідеальний. Тому інколи визначена мова може бути некоректною.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']