Subsetarea și curățarea unui DataFrame PySpark
După inspecția datelor, este adesea necesar să le curățăm – proces care implică, în principal, subsetarea, redenumirea coloanelor, eliminarea rândurilor duplicate etc. API-ul DataFrame din PySpark oferă mai mulți operatori pentru a face acest lucru. În acest exercițiu, sarcina ta este să extragi coloanele „name", „sex" și „date of birth" din DataFrame-ul people_df, să elimini rândurile duplicate din setul de date rezultat și să numeri rândurile înainte și după pasul de eliminare a duplicatelor.
Reține că ai deja o sesiune SparkSession spark și un DataFrame people_df disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Selectează coloanele „name", „sex" și „date of birth" din
people_dfși creează DataFrame-ulpeople_df_sub. - Afișează primele 10 observații din DataFrame-ul
people_df_sub. - Elimină intrările duplicate din DataFrame-ul
people_df_subși creează DataFrame-ulpeople_df_sub_nodup. - Câte rânduri există înainte și după eliminarea duplicatelor?
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)
# Print the first 10 observations from people_df_sub
people_df_sub.____(____)
# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()
# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))