始める無料で始める

レビューの正規化

映画レビューのデータセットから重要な語を抽出していきます。まずは正規化を行い、その後に出現頻度を数えます。正規化の一部には、すべての単語を小文字に変換し、特殊文字を取り除き、語幹を抽出して、語形の違いを1つとして数えることが含まれます。

たとえば、次のレビューがあるとします: The movie surprises me very muchMarvel movies always surprise their audience。そのまま頻度を数えると、surprises は1回、surprise も1回と数えられます。しかし、動詞 surprise はどちらにも現れているため、本来の頻度は2回とすべきです。

1件分の映画レビューのテキストは、変数 movie にすでに保存されています。IPython Shell で print(movie) を使うと中身を確認できます。

この演習はコースの一部です

Pythonで学ぶ正規表現

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Convert to lowercase and print the result
movie_lower = ____
print(____)
コードを編集して実行