规范化影评
现在是从电影影评数据集中提取关键信息的时候了。首先需要对文本进行规范化,然后统计词频。规范化的一部分包括将所有单词转换为小写、去除特殊字符,并提取词根,这样就能把同一词的不同变体按一个词来计数。
比如有以下两条影评:The movie surprises me very much 和 Marvel movies always surprise their audience。如果直接统计词频,您会得到 surprises 出现 1 次,surprise 出现 1 次。然而动词 surprise 实际上在两句中都出现了,它的频次应该是 2。
示例中一条电影影评的文本已保存在变量 movie 中。您可以使用 print(movie) 在 IPython Shell 中查看该变量。
本练习是课程的一部分
Python 中的正则表达式
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Convert to lowercase and print the result
movie_lower = ____
print(____)