ÎncepețiÎncepe gratuit

Subsetarea și curățarea unui DataFrame PySpark

După inspecția datelor, este adesea necesar să le curățăm – proces care implică, în principal, subsetarea, redenumirea coloanelor, eliminarea rândurilor duplicate etc. API-ul DataFrame din PySpark oferă mai mulți operatori pentru a face acest lucru. În acest exercițiu, sarcina ta este să extragi coloanele „name", „sex" și „date of birth" din DataFrame-ul people_df, să elimini rândurile duplicate din setul de date rezultat și să numeri rândurile înainte și după pasul de eliminare a duplicatelor.

Reține că ai deja o sesiune SparkSession spark și un DataFrame people_df disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Selectează coloanele „name", „sex" și „date of birth" din people_df și creează DataFrame-ul people_df_sub.
  • Afișează primele 10 observații din DataFrame-ul people_df_sub.
  • Elimină intrările duplicate din DataFrame-ul people_df_sub și creează DataFrame-ul people_df_sub_nodup.
  • Câte rânduri există înainte și după eliminarea duplicatelor?

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)

# Print the first 10 observations from people_df_sub
people_df_sub.____(____)

# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()

# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))
Editează și rulează codul