始める無料で始める

マッチして分割する

データセット内の一部のツイートは誤ってダウンロードされています。単語の区切りがスペースではなく、奇妙な文字で区切られています。これを正規表現で処理することにしました。どのパターンにマッチさせればよいか理解するため、いくつかのツイートを表示して確認します。

観察すると、文は常に「特殊文字 + 数字 + 単語 break + 特殊文字」で区切られていることがわかります(例: &4break!)。一方、単語は常に「特殊文字 + 単語 new + 通常のランダムな文字」で区切られています(例: #newH)。

1件のツイート本文を含む変数 sentiment_analysis と、re モジュールはすでに読み込まれています。IPython シェルで print(sentiment_analysis) を使って中身を確認できます。

この演習はコースの一部です

Pythonで学ぶ正規表現

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Write a regex to match pattern separating sentences
regex_sentence = ____"____"
コードを編集して実行