開始使用免費開始

具有時間標記資料的串列生成式

你現在要運用本章學到的內容,來解一個簡單的資料擷取問題。在這個練習中,你也會看到一種資料結構:pandas 的 Series。我們不會在此詳述,但你需要知道的是,在分析來自 pandas DataFrame 的資料時,你會非常常用到它。你可以把 DataFrame 的欄位想成名為 Series 的一維陣列。

在這個練習中,你會使用串列生成式,從帶有時間戳記的 Twitter 資料中擷取時間。pandas 套件已經以 pd 匯入,且檔案 'tweets.csv' 已匯入為 DataFrame df 供你使用。

本練習屬於課程

Python 工具箱

檢視課程

練習說明

  • df 中擷取欄位 'created_at',並將結果指派給 tweet_time。小知識:這裡擷取到並存於 tweet_time 的欄位是一個 Series 資料結構!
  • 建立一個串列生成式,從 tweet_time 中每一列擷取時間。每一列都是代表時間戳記的字串,你將取出該字串中的「第 12 到第 19 個字元」來擷取時間。使用 entry 作為「迭代變數」,並將結果指派給 tweet_clock_time。記得 Python 採用從 0 開始的索引!

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Extract the created_at column from df: tweet_time
tweet_time = ____

# Extract the clock time: tweet_clock_time
tweet_clock_time = [____]

# Print the extracted times
print(tweet_clock_time)
編輯並執行程式碼