ÎncepețiÎncepe gratuit

Stemizează recenzii în spaniolă

Îți amintești că într-un capitol anterior am folosit un pachet de detectare a limbii pentru a determina în ce limbă sunt scrise diferite recenzii de produse Amazon. În acest exercițiu, vei detecta mai întâi limbile din non_english_reviews. Recenziile sunt în mai multe limbi, dar vei selecta DOAR pe cele în spaniolă. Nu ezita să te întorci la videoclipul despre detectarea limbilor străine dacă ai uitat unele concepte.

În al doilea pas, vei crea token-uri de cuvinte din recenziile în spaniolă și le vei stemiza folosind un stemmer SnowBall pentru limba spaniolă. Din păcate, pachetul de detectare a limbii nu este perfect. Prin urmare, este posibil ca uneori limba detectată să nu fie corectă.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
Editează și rulează codul