Строковые операторы с данными Twitter
Вы продолжаете работать с набором данных tweets, где в столбце text хранится содержимое каждого твита.
Ваша задача — преобразовать столбец text в список токенов. Затем с помощью строковых операторов удалите все небуквенные символы из полученного списка токенов.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте функцию токенизации слов.
- Создайте токены слов из каждого твита.
- Отфильтруйте все небуквенные символы из полученного списка, то есть оставьте только буквы.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the word tokenizing package
____
# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])
# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])