筛选 pandas DataFrame
从源系统提取数据后,就该开始转换了!源数据往往包含超出下游用例所需的信息。遇到这种情况,应在数据管道的 "transform" 阶段降低维度。
已将 pandas 以 pd 导入,并提供了 extract() 函数,您可以传入路径来加载一个 DataFrame。
本练习是课程的一部分
使用 Python 的 ETL 和 ELT
练习说明
- 使用
extract()函数从"sales_data.parquet"路径加载 DataFrame。 - 更新
transform()函数,使其返回"Quantity Ordered"大于 1 的所有行和列。 - 进一步筛选
clean_dataDataFrame,只保留列"Order Date"、"Quantity Ordered"和"Purchase Address"。 - 返回筛选后的 DataFrame。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)