Mulai sekarangMulai gratis

Menambahkan Kolom ID

Saat bekerja dengan data, terkadang Anda hanya ingin mengakses bidang tertentu dan melakukan berbagai operasi. Dalam kasus ini, temukan semua nama pemilih yang unik dari DataFrame dan tambahkan nomor ID unik. Ingat bahwa ID Spark ditetapkan berdasarkan partisi DataFrame — sehingga nilai ID bisa jauh lebih besar daripada jumlah baris sebenarnya dalam DataFrame.

Dengan pemrosesan lazy di Spark, ID sebenarnya tidak dibuat hingga sebuah aksi dijalankan dan bisa agak acak tergantung pada ukuran himpunan data.

Sesi spark dan sebuah DataFrame Spark df yang memuat berkas DallasCouncilVotes.csv.gz tersedia di workspace Anda. Pustaka pyspark.sql.functions tersedia dengan alias F.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Pilih entri unik dari kolom VOTER NAME dan buat DataFrame baru bernama voter_df.
  • Hitung jumlah baris dalam DataFrame voter_df.
  • Tambahkan kolom ROW_ID menggunakan fungsi Spark yang sesuai.
  • Tampilkan baris dengan 10 nilai ROW_ID tertinggi.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()

# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)

# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())

# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)
Edit dan Jalankan Kode