开始使用免费开始使用

筛选 pandas DataFrame

从源系统提取数据后,就该开始转换了!源数据往往包含超出下游用例所需的信息。遇到这种情况,应在数据管道的 "transform" 阶段降低维度。

已将 pandaspd 导入,并提供了 extract() 函数,您可以传入路径来加载一个 DataFrame。

本练习是课程的一部分

使用 Python 的 ETL 和 ELT

查看课程

练习说明

  • 使用 extract() 函数从 "sales_data.parquet" 路径加载 DataFrame。
  • 更新 transform() 函数,使其返回 "Quantity Ordered" 大于 1 的所有行和列。
  • 进一步筛选 clean_data DataFrame,只保留列 "Order Date""Quantity Ordered""Purchase Address"
  • 返回筛选后的 DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
编辑并运行代码