始める無料で始める

ファイルの検出

ツイートのデータセットをクリーニングしましたが、まだ感情分析に役立たない余計な文字列が残っています。その中にはテキストファイル名を指す文字列があります。

それらを検出するルールは次のとおりです:

  • 文字列の先頭に現れます。
  • 先頭は大文字・小文字を問わず、連続する2~3文字の母音(a e i o u)で始まります。
  • 末尾は常に txt で終わります。

すぐに削除してよいか確信が持てないため、まずはそれらを検出して別のデータセットに保存するスクリプトを書くことにしました。

補助として使うメタ文字をメモしました: 先頭を表す ^、任意の1文字を表す .

2つのツイート文を含む変数 sentiment_analysis と、re モジュールはすでに読み込まれています。IPython Shell で print() を使って中身を確認できます。

この演習はコースの一部です

Pythonで学ぶ正規表現

コースを見る

演習の手順

  • テキストファイル名のパターンにマッチする正規表現を書いてください(例: aemyfile.txt)。
  • sentiment_analysis の各要素に対して、その正規表現にマッチするすべてを検索し、結果を出力してください。
  • マッチした部分を空文字列 "" に置換し、結果を出力してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
コードを編集して実行