ÎncepețiÎncepe gratuit

Operatori pe șiruri de caractere cu datele de pe Twitter

Continui să lucrezi cu setul de date tweets, în care coloana text conține conținutul fiecărui tweet.

Sarcina ta este să transformi coloana text într-o listă de tokeni. Apoi, folosind operatori pe șiruri de caractere, elimină toate caracterele non-alfabetice din lista de tokeni creată.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcția de tokenizare a cuvintelor.
  • Creează tokeni din fiecare tweet.
  • Filtrează toate caracterele non-alfabetice din lista creată, adică păstrează doar literele.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
Editează și rulează codul