开始使用免费开始使用

换个名字试试

您仍在进行 Twitter 情感分析。现在,您想分析一些引起注意的现象。您发现有些推文中插入了电子邮箱地址。于是,您想知道最常见的名字是什么。

您希望提取邮箱的第一部分。例如,若邮箱为 [email protected],您只关心 marysmith90。 您需要匹配整个表达式,这样就能确保只提取出现在邮箱中的名字。此外,您只关心由大写字母(如 A、B、Z)、小写字母(如 a、d、z)和数字组成的名字。

列表 sentiment_analysis(包含 3 条推文的文本)以及 re 模块已加载到您的会话中。您可以使用 print() 在 IPython Shell 中查看。

本练习是课程的一部分

Python 中的正则表达式

查看课程

练习说明

  • 完成正则表达式以匹配邮箱,并仅捕获名字部分。名字部分位于 @ 之前。
  • sentiment_analysis 的每个元素中查找该正则的所有匹配。将结果赋值给变量 email_matched
  • 补全 .format() 方法,以打印 sentiment_analysis 各元素中捕获的结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Write a regex that matches email
regex_email = r"___[____]____\S+"

for tweet in sentiment_analysis:
    # Find all matches of regex in each tweet
    email_matched = re.____(____, ____)

    # Complete the format method to print the results
    print("Lists of users found in this tweet: {}".format(____))
编辑并运行代码