正規化評論
現在該從你的電影評論資料集中擷取一些重要的字詞了。首先,你需要先進行正規化,接著再計算詞頻。正規化的一部分包含把所有單字轉成小寫、移除特殊字元,並且抽取單字的詞根,讓同一單字的不同變化只算作一次。
想像你有以下兩則評論:The movie surprises me very much 和 Marvel movies always surprise their audience。如果直接計算詞頻,會得到 surprises 1 次、surprise 1 次。然而動詞 surprise 在兩句中都有出現,因此它的正確頻率應該是 2。
我們已經把一則電影評論的文字存入變數 movie。你可以在 IPython Shell 中使用 print(movie) 檢視這個變數。
本練習屬於課程
Python 中的正規表示法
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Convert to lowercase and print the result
movie_lower = ____
print(____)