ПочатиПочніть безкоштовно

Оператори для рядків із даними Twitter

Ви продовжуєте працювати з даними tweets, де стовпець text містить вміст кожного твіту.

Ваше завдання — перетворити стовпець text на список токенів. Потім, використовуючи оператори для рядків, видаліть усі неалфавітні символи зі створеного списку токенів.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте функцію для токенізації слів.
  • Створіть токени слів для кожного твіту.
  • Відфільтруйте всі неалфавітні символи зі створеного списку, тобто залиште лише літери.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
Редагувати та запускати код