Stemování španělských recenzí
Možná si vzpomínáš, že v předchozí kapitole jsme použili balíček pro detekci jazyka, abychom zjistili, v jakém jazyce jsou různé recenze produktů z Amazonu. V tomto cvičení nejprve detekunješ jazyky v non_english_reviews. Recenze jsou ve více jazycích, ale vybereme POUZE ty španělské. Pokud sis nepamatuješ všechny pojmy, klidně se vrať zpět k videu o detekci cizích jazyků.
V druhém kroku vytvoříš tokeny slov ze španělských recenzí a aplikuješ na ně stemmer SnowBall pro španělský jazyk. Balíček pro detekci jazyka bohužel není dokonalý, takže se může stát, že detekovaný jazyk občas nebude správný.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']