通过连接校验行
另一种过滤数据的方法是通过连接来移除无效记录。您需要根据名为 valid_folders_df 的给定 DataFrame 来验证文件夹名称是否符合预期。DataFrame split_df 与您上一次处理时相同,包含一组拆分后的列。
spark 对象可用,且已将 pyspark.sql.functions 以 F 导入。
本练习是课程的一部分
使用 PySpark 进行数据清洗
练习说明
- 将
valid_folders_dfDataFrame 上的_c0列重命名为folder。 - 统计
split_df的行数。 - 按文件夹名称连接两个 DataFrame,并将结果 DataFrame 命名为
joined_df。请确保对更小的 DataFrame 使用广播。 - 查看连接后剩余的行数并进行比较。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))