조인으로 행 검증하기
데이터를 필터링하는 또 다른 방법은 조인을 사용해 유효하지 않은 항목을 제거하는 것입니다. 주어진 DataFrame valid_folders_df를 기준으로 폴더 이름이 예상대로인지 확인해야 합니다. DataFrame split_df는 마지막에 작업하던 대로 분리된 열들이 포함되어 있습니다.
spark 객체를 사용할 수 있고, pyspark.sql.functions는 F로 임포트되어 있습니다.
이 연습은 강의의 일부입니다
PySpark로 데이터 정제하기
연습 안내
valid_folders_dfDataFrame에서_c0열 이름을folder로 바꾸세요.split_df의 행 수를 세세요.- 두 DataFrame을 폴더 이름으로 조인하고, 결과 DataFrame의 이름을
joined_df로 지정하세요. 더 작은 DataFrame은 반드시 브로드캐스트하세요. - DataFrame에 남은 행 수를 확인하고 비교하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))