Mulai sekarangMulai gratis

Memeriksa baris tidak valid

Anda telah berhasil menyaring baris menggunakan join, tetapi terkadang Anda ingin meninjau data yang tidak valid. Data ini dapat disimpan untuk diproses nanti atau untuk menelusuri masalah pada sumber data Anda.

Anda ingin mencari selisih antara dua DataFrame dan menyimpan baris yang tidak valid.

Objek spark sudah didefinisikan dan pyspark.sql.functions telah diimpor sebagai F. DataFrame asli split_df dan DataFrame hasil join joined_df tersedia seperti pada kondisi sebelumnya.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Tentukan jumlah baris untuk setiap DataFrame.
  • Buat DataFrame yang hanya berisi baris tidak valid.
  • Validasi bahwa jumlah pada DataFrame baru sudah sesuai harapan.
  • Tentukan jumlah baris folder unik yang dihapus.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
Edit dan Jalankan Kode