查找文件
您对 tweets 数据集的清洗还不满意。仍有多余的字符串没有提供任何情感信息。其中包括指向文本文件名的字符串。
您也找到了检测它们的方法:
- 它们出现在字符串的开头。
- 它们总是以 2 或 3 个元音字母(大小写均可,a e i o u)开头。
- 它们总是以
txt结尾。
您不确定是否应该直接删除这些字符串。因此,您编写脚本来查找并将它们存储到单独的数据集中。
您记下了一些会用到的元字符:^ 表示开头锚点,. 表示任意字符。
变量 sentiment_analysis(包含两条推文的文本)以及模块 re 已加载到当前会话。您可以使用 print() 在 IPython Shell 中查看。
本练习是课程的一部分
Python 中的正则表达式
练习说明
- 编写一个正则表达式,匹配文本文件名的模式,例如
aemyfile.txt。 - 在
sentiment_analysis的各个元素中查找该正则的所有匹配。打印结果。 - 将所有匹配替换为空字符串
""。打印结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))