Stemming các đánh giá tiếng Tây Ban Nha
Bạn có thể nhớ rằng ở một chương trước, chúng ta đã dùng một gói phát hiện ngôn ngữ để xác định ngôn ngữ của các đánh giá sản phẩm Amazon khác nhau. Trong bài tập này, trước tiên bạn sẽ phát hiện ngôn ngữ trong non_english_reviews. Các đánh giá ở nhiều ngôn ngữ, nhưng bạn sẽ CHỈ chọn những đánh giá bằng tiếng Tây Ban Nha. Nếu quên một số khái niệm, bạn có thể xem lại video nói về phát hiện ngôn ngữ nước ngoài.
Ở bước thứ hai, bạn sẽ tạo các token từ các đánh giá tiếng Tây Ban Nha và thực hiện stemming chúng bằng SnowBall stemmer cho tiếng Tây Ban Nha. Đáng tiếc là gói phát hiện ngôn ngữ không hoàn hảo. Vì vậy đôi khi ngôn ngữ được phát hiện có thể không chính xác.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']