开始使用免费开始使用

通过连接校验行

另一种过滤数据的方法是通过连接来移除无效记录。您需要根据名为 valid_folders_df 的给定 DataFrame 来验证文件夹名称是否符合预期。DataFrame split_df 与您上一次处理时相同,包含一组拆分后的列。

spark 对象可用,且已将 pyspark.sql.functionsF 导入。

本练习是课程的一部分

使用 PySpark 进行数据清洗

查看课程

练习说明

  • valid_folders_df DataFrame 上的 _c0 列重命名为 folder
  • 统计 split_df 的行数。
  • 按文件夹名称连接两个 DataFrame,并将结果 DataFrame 命名为 joined_df。请确保对更小的 DataFrame 使用广播。
  • 查看连接后剩余的行数并进行比较。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
编辑并运行代码