BaşlayınÜcretsiz başlayın

İspanyolca yorumlarda kök bulma (stemming)

Önceki bir bölümde, farklı Amazon ürün yorumlarının dilini belirlemek için bir dil algılama paketini kullandığımızı hatırlayacaksın. Bu egzersizde önce non_english_reviews içindeki dilleri tespit edeceksin. Yorumlar birden fazla dilde, ancak SEN sadece İspanyolca olanları seçeceksin. Kavramları unuttuysan, yabancı dil tespitini anlatan videoya geri dönebilirsin.

İkinci adımda, İspanyolca yorumlardan sözcük belirteçleri (token) oluşturacak ve bunları İspanyolca için SnowBall gövdeleyici (stemmer) ile köklerine indireceksin. Ne yazık ki dil algılama paketi mükemmel değil. Bu nedenle, bazen tespit edilen dil doğru olmayabilir.

Bu egzersiz, kursun bir parçasıdır

Python ile Duygu Analizi

Kursa Göz Atın

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
Kodu Düzenle ve Çalıştır