Další řetězcové operátory a Twitter
V tomto cvičení použiješ různé řetězcové operátory na tři řetězce vybrané z datasetu tweets. Seznam tweets_list je pro tebe již připravený.
Sestav tři nové seznamy pomocí různých řetězcových operátorů:
- seznam obsahující pouze písmena
- seznam obsahující pouze alfanumerické znaky
- seznam obsahující pouze číslice
Potřebné funkce jsou za tebe již naimportované z nltk.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Vytvoř seznam tokenů ze
tweets_list. - V seznamu
lettersodstraň všechny číslice a ostatní znaky — ponech pouze písmena. - V
let_digitsponech alfanumerické znaky a odstraň všechny ostatní. - Vytvoř
digitstak, že odstraníš písmena i ostatní znaky a ponecháš pouze čísla.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a list of lists, containing the tokens from list_tweets
tokens = [____(item) for item in tweets_list]
# Remove characters and digits , i.e. retain only letters
letters = [[word for word in item if ____.____] for item in tokens]
# Remove characters, i.e. retain only letters and digits
let_digits = [[word for word in item if ____.____] for item in tokens]
# Remove letters and characters, retain only digits
digits = [[word for word in item if ____.____] for item in tokens]
# Print the last item in each list
print('Last item in alphabetic list: ', letters[2])
print('Last item in list of alphanumerics: ', let_digits[2])
print('Last item in the list of digits: ', digits[2])