시작하기무료로 시작하기

잘못된 행 살펴보기

조인을 통해 행을 성공적으로 걸러냈지만, 때로는 유효하지 않은 데이터를 직접 확인하고 싶을 때가 있어요. 이런 데이터는 나중에 처리하거나 데이터 소스를 문제 해결할 때 활용할 수 있습니다.

두 개의 DataFrame 간 차이를 찾아 유효하지 않은 행을 저장하려고 합니다.

spark 객체가 정의되어 있고 pyspark.sql.functionsF로 임포트되어 있어요. 원본 DataFrame split_df와 조인된 DataFrame joined_df는 이전 상태 그대로 사용할 수 있습니다.

이 연습은 강의의 일부입니다

PySpark로 데이터 정제하기

강의 보기

연습 안내

  • 각 DataFrame의 행 수를 확인하세요.
  • 유효하지 않은 행만 포함하는 DataFrame을 만드세요.
  • 새 DataFrame의 개수가 예상과 일치하는지 검증하세요.
  • 제거된 폴더 행의 고유 개수를 구하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
코드 편집 및 실행