开始使用免费开始使用

彻底清理

回到您的 Twitter 情感分析项目!有几类字符串会增加情感分析的复杂度,但这些字符串并不提供有用的情感信息。其中包括链接和用户提及。

为清理推文,您想先提取一些示例。您知道大多数链接以 http 开头,且不包含任何空白字符,例如 https://www.datacamp.com。用户提及以 @ 开头,并且只能包含字母和数字,例如 @johnsmith3

您记录了一些有用的量词以帮助您:* 表示重复 0 次或多次,+ 表示重复 1 次或多次,? 表示重复 0 次或 1 次。

列表 sentiment_analysis(包含三条推文的文本)已加载到您的会话中。您可以使用 print() 在 IPython Shell 中查看数据。

本练习是课程的一部分

Python 中的正则表达式

查看课程

练习说明

  • 导入 re 模块。
  • 编写一个正则表达式,找到 sentiment_analysis 中每条 tweet 里出现的所有 http 链接匹配项。打印结果。
  • 编写一个正则表达式,找到 sentiment_analysis 中每条 tweet 里出现的所有用户提及匹配项。打印结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
编辑并运行代码