開始使用免費開始

尋找檔案

你對 tweets 資料集的清理結果不太滿意。仍有多餘的字串,對情緒判斷沒有幫助。其中包含一些代表文字檔檔名的字串。

你也找出一種偵測方式:

  • 它們出現在字串的開頭。
  • 一定以 2 或 3 個母音(大小寫皆可,a e i o u)的序列開頭。
  • 一定以 txt 作結。

你不確定是否該直接移除它們,因此你寫了一個指令碼先把它們找出來,並存成另一個資料集。

你列出幾個會用到的特殊字元:^(錨定開頭)、.(任意字元)。

變數 sentiment_analysis(包含兩則推文的文字)以及 re 模組已載入到你的工作階段。你可以在 IPython Shell 使用 print() 檢視。

本練習屬於課程

Python 中的正規表示法

檢視課程

練習說明

  • 撰寫一個能比對文字檔檔名樣式的正則表達式,例如 aemyfile.txt
  • sentiment_analysis 各元素中尋找此正則表達式的所有相符結果。將結果印出。
  • 將所有相符結果以空字串 "" 取代。將結果印出。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
編輯並執行程式碼