Začněte nyníZačněte zdarma

Řetězcové operátory s daty z Twitteru

Pokračuješ v práci s daty tweets, kde sloupec text obsahuje obsah každého tweetu.

Tvým úkolem je převést sloupec text na seznam tokenů. Pak pomocí řetězcových operátorů odstraň z vytvořeného seznamu tokenů všechny nealfabetické znaky.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj funkci pro tokenizaci slov.
  • Vytvoř tokeny slov z každého tweetu.
  • Vyfiltruj z vytvořeného seznamu všechny nealfabetické znaky, tedy ponech pouze písmena.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
Upravit a spustit kód