换个名字试试
您仍在进行 Twitter 情感分析。现在,您想分析一些引起注意的现象。您发现有些推文中插入了电子邮箱地址。于是,您想知道最常见的名字是什么。
您希望提取邮箱的第一部分。例如,若邮箱为 [email protected],您只关心 marysmith90。
您需要匹配整个表达式,这样就能确保只提取出现在邮箱中的名字。此外,您只关心由大写字母(如 A、B、Z)、小写字母(如 a、d、z)和数字组成的名字。
列表 sentiment_analysis(包含 3 条推文的文本)以及 re 模块已加载到您的会话中。您可以使用 print() 在 IPython Shell 中查看。
本练习是课程的一部分
Python 中的正则表达式
练习说明
- 完成正则表达式以匹配邮箱,并仅捕获名字部分。名字部分位于
@之前。 - 在
sentiment_analysis的每个元素中查找该正则的所有匹配。将结果赋值给变量email_matched。 - 补全
.format()方法,以打印sentiment_analysis各元素中捕获的结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Write a regex that matches email
regex_email = r"___[____]____\S+"
for tweet in sentiment_analysis:
# Find all matches of regex in each tweet
email_matched = re.____(____, ____)
# Complete the format method to print the results
print("Lists of users found in this tweet: {}".format(____))