Stamma spanska recensioner
Du kanske minns att vi i ett tidigare kapitel använde ett språkdetekteringspaket för att avgöra vilket språk olika Amazon-produktrecensioner var skrivna på. I den här övningen ska du först identifiera språken i non_english_reviews. Recensionerna är på flera olika språk, men du väljer ENDAST de som är på spanska. Gå gärna tillbaka till videon om språkdetektering om du behöver fräscha upp minnet.
I nästa steg skapar du ordtoken från de spanska recensionerna och stammar dem med en SnowBall-stammare för spanska. Språkdetekteringspaketet är tyvärr inte helt felfritt, så det kan hända att det ibland identifierar fel språk.
Den här övningen är en del av kursen
Sentimentanalys i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']