Operatori pe șiruri de caractere cu datele de pe Twitter
Continui să lucrezi cu setul de date tweets, în care coloana text conține conținutul fiecărui tweet.
Sarcina ta este să transformi coloana text într-o listă de tokeni. Apoi, folosind operatori pe șiruri de caractere, elimină toate caracterele non-alfabetice din lista de tokeni creată.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă funcția de tokenizare a cuvintelor.
- Creează tokeni din fiecare tweet.
- Filtrează toate caracterele non-alfabetice din lista creată, adică păstrează doar literele.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the word tokenizing package
____
# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])
# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])