НачатьНачать бесплатно

Стемминг испанских отзывов

Вы, возможно, помните, что в предыдущей главе мы использовали пакет для определения языка, чтобы классифицировать отзывы на продукты Amazon. В этом упражнении вы сначала определите языки в non_english_reviews. Отзывы написаны на разных языках, но вам нужно выбрать ТОЛЬКО те, что на испанском. Если вы забыли некоторые концепции, можете вернуться к видео об определении языка текста.

На втором шаге вы создадите токены слов из испанских отзывов и выполните их стемминг с помощью стеммера SnowBall для испанского языка. К сожалению, пакет определения языка работает не идеально. Поэтому иногда определённый язык может оказаться неверным.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
Редактировать и запускать код