具有時間標記資料的串列生成式
你現在要運用本章學到的內容,來解一個簡單的資料擷取問題。在這個練習中,你也會看到一種資料結構:pandas 的 Series。我們不會在此詳述,但你需要知道的是,在分析來自 pandas DataFrame 的資料時,你會非常常用到它。你可以把 DataFrame 的欄位想成名為 Series 的一維陣列。
在這個練習中,你會使用串列生成式,從帶有時間戳記的 Twitter 資料中擷取時間。pandas 套件已經以 pd 匯入,且檔案 'tweets.csv' 已匯入為 DataFrame df 供你使用。
本練習屬於課程
Python 工具箱
練習說明
- 從
df中擷取欄位'created_at',並將結果指派給tweet_time。小知識:這裡擷取到並存於tweet_time的欄位是一個 Series 資料結構! - 建立一個串列生成式,從
tweet_time中每一列擷取時間。每一列都是代表時間戳記的字串,你將取出該字串中的「第 12 到第 19 個字元」來擷取時間。使用entry作為「迭代變數」,並將結果指派給tweet_clock_time。記得 Python 採用從 0 開始的索引!
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Extract the created_at column from df: tweet_time
tweet_time = ____
# Extract the clock time: tweet_clock_time
tweet_clock_time = [____]
# Print the extracted times
print(tweet_clock_time)