尋找檔案
你對 tweets 資料集的清理結果不太滿意。仍有多餘的字串,對情緒判斷沒有幫助。其中包含一些代表文字檔檔名的字串。
你也找出一種偵測方式:
- 它們出現在字串的開頭。
- 一定以 2 或 3 個母音(大小寫皆可,a e i o u)的序列開頭。
- 一定以
txt作結。
你不確定是否該直接移除它們,因此你寫了一個指令碼先把它們找出來,並存成另一個資料集。
你列出幾個會用到的特殊字元:^(錨定開頭)、.(任意字元)。
變數 sentiment_analysis(包含兩則推文的文字)以及 re 模組已載入到你的工作階段。你可以在 IPython Shell 使用 print() 檢視。
本練習屬於課程
Python 中的正規表示法
練習說明
- 撰寫一個能比對文字檔檔名樣式的正則表達式,例如
aemyfile.txt。 - 在
sentiment_analysis各元素中尋找此正則表達式的所有相符結果。將結果印出。 - 將所有相符結果以空字串
""取代。將結果印出。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))