开始使用免费开始使用

在 Twitter 数据上使用字符串运算符

您将继续使用 tweets 数据,其中 text 列存储每条推文的内容。

您的任务是将 text 列转换为由词元组成的列表。然后,使用字符串运算符,从生成的词元列表中移除所有非字母字符。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • 导入分词函数。
  • 从每条推文中创建词元。
  • 从生成的列表中过滤掉所有非字母字符,即仅保留字母。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
编辑并运行代码