Strängoperatorer med Twitter-data
Du fortsätter att arbeta med tweets-datamängden där kolumnen text innehåller innehållet i varje tweet.
Din uppgift är att omvandla kolumnen text till en lista med tokens. Använd sedan strängoperatorer för att ta bort alla icke-alfabetiska tecken från den skapade tokenlistan.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Importera ordtokeniseringsfunktionen.
- Skapa ordtokens från varje tweet.
- Filtrera bort alla icke-alfabetiska tecken från den skapade listan, dvs. behåll enbart bokstäver.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the word tokenizing package
____
# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])
# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])