Stemizează recenzii în spaniolă
Îți amintești că într-un capitol anterior am folosit un pachet de detectare a limbii pentru a determina în ce limbă sunt scrise diferite recenzii de produse Amazon. În acest exercițiu, vei detecta mai întâi limbile din non_english_reviews. Recenziile sunt în mai multe limbi, dar vei selecta DOAR pe cele în spaniolă. Nu ezita să te întorci la videoclipul despre detectarea limbilor străine dacă ai uitat unele concepte.
În al doilea pas, vei crea token-uri de cuvinte din recenziile în spaniolă și le vei stemiza folosind un stemmer SnowBall pentru limba spaniolă. Din păcate, pachetul de detectare a limbii nu este perfect. Prin urmare, este posibil ca uneori limba detectată să nu fie corectă.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']