Stemming recenzji w języku hiszpańskim
Pamiętasz, że w poprzednim rozdziale używaliśmy pakietu do wykrywania języka, aby określić język różnych recenzji produktów Amazon. W tym ćwiczeniu najpierw wykryjesz języki w non_english_reviews. Recenzje są w wielu językach, ale wybierzesz TYLKO te w języku hiszpańskim. Jeśli nie pamiętasz niektórych zagadnień, możesz wrócić do lekcji wideo na temat wykrywania języków obcych.
W drugim kroku utworzysz tokeny słów z hiszpańskich recenzji i zastosujesz stemming za pomocą stemmera SnowBall dla języka hiszpańskiego. Niestety pakiet do wykrywania języka nie jest doskonały. Czasem może zatem wykryć nieprawidłowy język.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']