開始使用免費開始

篩選 pandas DataFrame

從來源系統擷取到資料後,就該進行轉換了!來源資料常常包含比下游情境所需更多的資訊。遇到這種情況,就應該在資料管線的「transform」階段進行降維。

已將 pandaspd 匯入,並提供 extract() 函式,可用來從傳入的路徑載入一個 DataFrame。

本練習屬於課程

使用 Python 的 ETL 與 ELT

檢視課程

練習說明

  • 使用 extract() 函式,從 "sales_data.parquet" 路徑載入 DataFrame。
  • 更新 transform() 函式,讓它只回傳所有「"Quantity Ordered" 大於 1」的列與欄。
  • 進一步篩選 clean_data DataFrame,只保留 "Order Date""Quantity Ordered""Purchase Address" 欄位。
  • 回傳篩選後的 DataFrame。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
編輯並執行程式碼