ÎncepețiÎncepe gratuit

Rădăcini din tweets

În acest exercițiu, vei lucra cu un array numit tweets. Acesta conține textul datelor de sentiment despre companii aeriene, colectate de pe Twitter.

Sarcina ta este să lucrezi cu acest array și să îl transformi într-o listă de token-uri folosind list comprehension. După aceea, iterează peste lista de token-uri și creează o rădăcină (stem) din fiecare token. Ține minte că list comprehension este o alternativă pe o singură linie la buclele for.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcția folosită pentru a transforma șiruri de caractere în rădăcini (stems).
  • Apelează funcția Porter stemmer pe care tocmai ai importat-o.
  • Folosind list comprehension, creează lista tokens. Aceasta trebuie să conțină toate token-urile de cuvinte din array-ul tweets.
  • Iterează peste lista tokens și aplică funcția de stemming fiecărui element din listă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the function to perform stemming
____
from nltk import word_tokenize

# Call the stemmer
porter = ____()

# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens] 
# Print the first element of the list
print(stemmed_tokens[0])
Editează și rulează codul