НачатьНачать бесплатно

Строковые операторы с данными Twitter

Вы продолжаете работать с набором данных tweets, где в столбце text хранится содержимое каждого твита.

Ваша задача — преобразовать столбец text в список токенов. Затем с помощью строковых операторов удалите все небуквенные символы из полученного списка токенов.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функцию токенизации слов.
  • Создайте токены слов из каждого твита.
  • Отфильтруйте все небуквенные символы из полученного списка, то есть оставьте только буквы.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
Редактировать и запускать код