开始使用免费开始使用

理解二者的区别

您需要继续清洗 tweets 数据集。您发现其中包含一些 HTML 标签。需要移除这些标签,但要保留标签内的内容,因为这些内容对分析很有用。

来看这句话,它包含一个 HTML 标签:

I want to see that <strong>amazing show</strong> again!

您知道,要定位 HTML 标签,需要匹配位于尖括号 < > 之间的任何内容。但最大的问题是,闭合标签的结构是相同的。如果匹配过多,就会删除关键信息。因此,您需要决定使用贪婪量词还是懒惰量词。

字符串已作为 string 载入到您的会话中。

本练习是课程的一部分

Python 中的正则表达式

查看课程

练习说明

  • 导入 re 模块。
  • 编写一个 regex 表达式,将HTML 标签替换为空字符串。
  • 打印结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
编辑并运行代码