レビューの正規化
映画レビューのデータセットから重要な語を抽出していきます。まずは正規化を行い、その後に出現頻度を数えます。正規化の一部には、すべての単語を小文字に変換し、特殊文字を取り除き、語幹を抽出して、語形の違いを1つとして数えることが含まれます。
たとえば、次のレビューがあるとします: The movie surprises me very much と Marvel movies always surprise their audience。そのまま頻度を数えると、surprises は1回、surprise も1回と数えられます。しかし、動詞 surprise はどちらにも現れているため、本来の頻度は2回とすべきです。
1件分の映画レビューのテキストは、変数 movie にすでに保存されています。IPython Shell で print(movie) を使うと中身を確認できます。
この演習はコースの一部です
Pythonで学ぶ正規表現
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Convert to lowercase and print the result
movie_lower = ____
print(____)