Začněte nyníZačněte zdarma

Další řetězcové operátory a Twitter

V tomto cvičení použiješ různé řetězcové operátory na tři řetězce vybrané z datasetu tweets. Seznam tweets_list je pro tebe již připravený.

Sestav tři nové seznamy pomocí různých řetězcových operátorů:

  • seznam obsahující pouze písmena
  • seznam obsahující pouze alfanumerické znaky
  • seznam obsahující pouze číslice

Potřebné funkce jsou za tebe již naimportované z nltk.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř seznam tokenů ze tweets_list.
  • V seznamu letters odstraň všechny číslice a ostatní znaky — ponech pouze písmena.
  • V let_digits ponech alfanumerické znaky a odstraň všechny ostatní.
  • Vytvoř digits tak, že odstraníš písmena i ostatní znaky a ponecháš pouze čísla.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a list of lists, containing the tokens from list_tweets
tokens = [____(item) for item in tweets_list]

# Remove characters and digits , i.e. retain only letters
letters = [[word for word in item if ____.____] for item in tokens]
# Remove characters, i.e. retain only letters and digits
let_digits = [[word for word in item if ____.____] for item in tokens]
# Remove letters and characters, retain only digits
digits = [[word for word in item if ____.____] for item in tokens]

# Print the last item in each list
print('Last item in alphabetic list: ', letters[2])
print('Last item in list of alphanumerics: ', let_digits[2])
print('Last item in the list of digits: ', digits[2])
Upravit a spustit kód