彼らはボットでしょうか?
あなたが働いている会社から、ツイートのデータセットを使ってセンチメント分析を行うよう依頼されました。まずはクリーニングと情報抽出が必要です。
テキストを表示していると、一部のツイートにユーザーのメンションが含まれていることに気づきます。その中にはとても奇妙なパターンのものがあります。例として、@robot3!、@robot5&、@robot7# などです。
それらのユーザーがボットかどうかを分析するため、まずは 1 件のツイートで概念実証を行い、.findall() メソッドを使って抽出してみます。
後で役立つメタ文字をメモしておきます:
\d: 数字
\w: 単語構成文字
\W: 非単語文字
\s: 空白文字
あるツイートの本文は変数 sentiment_analysis に保存されています。IPython シェルで print(sentiment_analysis) を実行すると内容を確認できます。
この演習はコースの一部です
Pythonで学ぶ正規表現
演習の手順
reモジュールをインポートします。@で始まり、例の@robot3!のようなパターンに一致するユーザーメンションにマッチする正規表現を書きます。- そのパターンの一致を、変数
sentiment_analysisの中からすべて見つけます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the re module
____
# Write the regex
regex = ____"____"
# Find all matches of regex
print(re.____(____, ____))