マッチして分割する
データセット内の一部のツイートは誤ってダウンロードされています。単語の区切りがスペースではなく、奇妙な文字で区切られています。これを正規表現で処理することにしました。どのパターンにマッチさせればよいか理解するため、いくつかのツイートを表示して確認します。
観察すると、文は常に「特殊文字 + 数字 + 単語 break + 特殊文字」で区切られていることがわかります(例: &4break!)。一方、単語は常に「特殊文字 + 単語 new + 通常のランダムな文字」で区切られています(例: #newH)。
1件のツイート本文を含む変数 sentiment_analysis と、re モジュールはすでに読み込まれています。IPython シェルで print(sentiment_analysis) を使って中身を確認できます。
この演習はコースの一部です
Pythonで学ぶ正規表現
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Write a regex to match pattern separating sentences
regex_sentence = ____"____"