Mulai sekarangMulai gratis

Menghapus baris berkomentar

Atasan Anda meminta Anda melakukan parsing yang kompleks pada himpunan data baru. Data ini merepresentasikan data anotasi untuk himpunan data ImageNet, tetapi berfokus khusus pada ras anjing dan mengidentifikasinya dalam gambar. Sebelum analisis apa pun dapat dilakukan, Anda perlu membersihkan sejumlah komponen data yang tidak valid/keliru. Skema umum dokumen tidak diketahui sehingga Anda ingin mengimpor baris ke dalam satu kolom, agar dapat dianalisis dengan cepat.

Sebagai awal, Anda perlu menghapus semua baris berkomentar dalam himpunan data.

Konteks spark, dan berkas CSV dasar (annotations.csv.gz) tersedia untuk Anda gunakan. Fungsi col juga tersedia.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Impor berkas annotations.csv.gz ke sebuah DataFrame dan lakukan penghitungan baris. Tentukan karakter pemisah |.
  • Kueri data untuk jumlah baris yang diawali dengan #.
  • Impor kembali berkas tersebut ke DataFrame baru, tetapi tentukan karakter komentar di opsi untuk menghapus baris berkomentar apa pun.
  • Hitung DataFrame baru dan verifikasi selisihnya sesuai harapan.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Import the file to a DataFrame and perform a row count
annotations_df = spark.read.____('____', sep=____)
full_count = annotations_df.____

# Count the number of rows beginning with '#'
comment_count = annotations_df.____(col('_c0').____('#')).count()

# Import the file to a new DataFrame, without commented rows
no_comments_df = ____.____.____('____', ____=____, comment='____')

# Count the new DataFrame and verify the difference is as expected
no_comments_count = no_comments_df.count()
print("Full count: %d\nComment count: %d\nRemaining count: %d" % (____, ____, ____))
Edit dan Jalankan Kode