彻底清理
回到您的 Twitter 情感分析项目!有几类字符串会增加情感分析的复杂度,但这些字符串并不提供有用的情感信息。其中包括链接和用户提及。
为清理推文,您想先提取一些示例。您知道大多数链接以 http 开头,且不包含任何空白字符,例如 https://www.datacamp.com。用户提及以 @ 开头,并且只能包含字母和数字,例如 @johnsmith3。
您记录了一些有用的量词以帮助您:* 表示重复 0 次或多次,+ 表示重复 1 次或多次,? 表示重复 0 次或 1 次。
列表 sentiment_analysis(包含三条推文的文本)已加载到您的会话中。您可以使用 print() 在 IPython Shell 中查看数据。
本练习是课程的一部分
Python 中的正则表达式
练习说明
- 导入
re模块。 - 编写一个正则表达式,找到
sentiment_analysis中每条tweet里出现的所有http链接匹配项。打印结果。 - 编写一个正则表达式,找到
sentiment_analysis中每条tweet里出现的所有用户提及匹配项。打印结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))