ファイルの検出
ツイートのデータセットをクリーニングしましたが、まだ感情分析に役立たない余計な文字列が残っています。その中にはテキストファイル名を指す文字列があります。
それらを検出するルールは次のとおりです:
- 文字列の先頭に現れます。
- 先頭は大文字・小文字を問わず、連続する2~3文字の母音(a e i o u)で始まります。
- 末尾は常に
txtで終わります。
すぐに削除してよいか確信が持てないため、まずはそれらを検出して別のデータセットに保存するスクリプトを書くことにしました。
補助として使うメタ文字をメモしました: 先頭を表す ^、任意の1文字を表す .。
2つのツイート文を含む変数 sentiment_analysis と、re モジュールはすでに読み込まれています。IPython Shell で print() を使って中身を確認できます。
この演習はコースの一部です
Pythonで学ぶ正規表現
演習の手順
- テキストファイル名のパターンにマッチする正規表現を書いてください(例:
aemyfile.txt)。 sentiment_analysisの各要素に対して、その正規表現にマッチするすべてを検索し、結果を出力してください。- マッチした部分を空文字列
""に置換し、結果を出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))