Zacznij terazZacznij za darmo

Operatory łańcuchowe na danych z Twittera

Kontynuujesz pracę z danymi tweets, gdzie kolumna text przechowuje treść każdego tweeta.

Twoim zadaniem jest przekształcenie kolumny text w listę tokenów. Następnie, używając operatorów łańcuchowych, usuń wszystkie znaki niealfabetyczne z utworzonej listy tokenów.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj funkcję tokenizacji słów.
  • Utwórz tokeny słów z każdego tweeta.
  • Odfiltruj wszystkie znaki niealfabetyczne z utworzonej listy, tzn. zachowaj tylko litery.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
Edytuj i uruchom kod