Zacznij terazZacznij za darmo

Stemming recenzji w języku hiszpańskim

Pamiętasz, że w poprzednim rozdziale używaliśmy pakietu do wykrywania języka, aby określić język różnych recenzji produktów Amazon. W tym ćwiczeniu najpierw wykryjesz języki w non_english_reviews. Recenzje są w wielu językach, ale wybierzesz TYLKO te w języku hiszpańskim. Jeśli nie pamiętasz niektórych zagadnień, możesz wrócić do lekcji wideo na temat wykrywania języków obcych.

W drugim kroku utworzysz tokeny słów z hiszpańskich recenzji i zastosujesz stemming za pomocą stemmera SnowBall dla języka hiszpańskiego. Niestety pakiet do wykrywania języka nie jest doskonały. Czasem może zatem wykryć nieprawidłowy język.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
Edytuj i uruchom kod