Rădăcini din tweets
În acest exercițiu, vei lucra cu un array numit tweets. Acesta conține textul datelor de sentiment despre companii aeriene, colectate de pe Twitter.
Sarcina ta este să lucrezi cu acest array și să îl transformi într-o listă de token-uri folosind list comprehension. După aceea, iterează peste lista de token-uri și creează o rădăcină (stem) din fiecare token. Ține minte că list comprehension este o alternativă pe o singură linie la buclele for.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă funcția folosită pentru a transforma șiruri de caractere în rădăcini (stems).
- Apelează funcția Porter stemmer pe care tocmai ai importat-o.
- Folosind list comprehension, creează lista
tokens. Aceasta trebuie să conțină toate token-urile de cuvinte din array-ultweets. - Iterează peste lista
tokensși aplică funcția de stemming fiecărui element din listă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the function to perform stemming
____
from nltk import word_tokenize
# Call the stemmer
porter = ____()
# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens]
# Print the first element of the list
print(stemmed_tokens[0])