Memeriksa baris tidak valid
Anda telah berhasil menyaring baris menggunakan join, tetapi terkadang Anda ingin meninjau data yang tidak valid. Data ini dapat disimpan untuk diproses nanti atau untuk menelusuri masalah pada sumber data Anda.
Anda ingin mencari selisih antara dua DataFrame dan menyimpan baris yang tidak valid.
Objek spark sudah didefinisikan dan pyspark.sql.functions telah diimpor sebagai F. DataFrame asli split_df dan DataFrame hasil join joined_df tersedia seperti pada kondisi sebelumnya.
Latihan ini merupakan bagian dari kursus
Membersihkan Data dengan PySpark
Instruksi latihan
- Tentukan jumlah baris untuk setiap DataFrame.
- Buat DataFrame yang hanya berisi baris tidak valid.
- Validasi bahwa jumlah pada DataFrame baru sudah sesuai harapan.
- Tentukan jumlah baris folder unik yang dihapus.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____
# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')
# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))
# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)