开始使用免费开始使用

查找文件

您对 tweets 数据集的清洗还不满意。仍有多余的字符串没有提供任何情感信息。其中包括指向文本文件名的字符串。

您也找到了检测它们的方法:

  • 它们出现在字符串的开头。
  • 它们总是以 2 或 3 个元音字母(大小写均可,a e i o u)开头。
  • 它们总是以 txt 结尾。

您不确定是否应该直接删除这些字符串。因此,您编写脚本来查找并将它们存储到单独的数据集中。

您记下了一些会用到的元字符:^ 表示开头锚点,. 表示任意字符。

变量 sentiment_analysis(包含两条推文的文本)以及模块 re 已加载到当前会话。您可以使用 print() 在 IPython Shell 中查看。

本练习是课程的一部分

Python 中的正则表达式

查看课程

练习说明

  • 编写一个正则表达式,匹配文本文件名的模式,例如 aemyfile.txt
  • sentiment_analysis 的各个元素中查找该正则的所有匹配。打印结果。
  • 将所有匹配替换为空字符串 ""。打印结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
编辑并运行代码