İspanyolca yorumlarda kök bulma (stemming)
Önceki bir bölümde, farklı Amazon ürün yorumlarının dilini belirlemek için bir dil algılama paketini kullandığımızı hatırlayacaksın. Bu egzersizde önce non_english_reviews içindeki dilleri tespit edeceksin. Yorumlar birden fazla dilde, ancak SEN sadece İspanyolca olanları seçeceksin. Kavramları unuttuysan, yabancı dil tespitini anlatan videoya geri dönebilirsin.
İkinci adımda, İspanyolca yorumlardan sözcük belirteçleri (token) oluşturacak ve bunları İspanyolca için SnowBall gövdeleyici (stemmer) ile köklerine indireceksin. Ne yazık ki dil algılama paketi mükemmel değil. Bu nedenle, bazen tespit edilen dil doğru olmayabilir.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']