开始使用免费开始使用

规范化影评

现在是从电影影评数据集中提取关键信息的时候了。首先需要对文本进行规范化,然后统计词频。规范化的一部分包括将所有单词转换为小写、去除特殊字符,并提取词根,这样就能把同一词的不同变体按一个词来计数。

比如有以下两条影评:The movie surprises me very muchMarvel movies always surprise their audience。如果直接统计词频,您会得到 surprises 出现 1 次,surprise 出现 1 次。然而动词 surprise 实际上在两句中都出现了,它的频次应该是 2。

示例中一条电影影评的文本已保存在变量 movie 中。您可以使用 print(movie) 在 IPython Shell 中查看该变量。

本练习是课程的一部分

Python 中的正则表达式

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Convert to lowercase and print the result
movie_lower = ____
print(____)
编辑并运行代码