Interogări SQL pentru filtrarea tabelelor
În exercițiul anterior, ai rulat o interogare SQL simplă pe un DataFrame. Poți construi interogări mai complexe pentru a obține rezultatele dorite și a le folosi în analize ulterioare, cum ar fi vizualizarea datelor și Machine Learning. În acest exercițiu, vei folosi tabela temporară people creată anterior, vei filtra rândurile în funcție de sexul „male" sau „female" și vei crea două DataFrame-uri.
Reține că „soluția" este sensibilă la majuscule în cazul comenzilor SQL (de exemplu, acceptă doar FROM, nu și from). De asemenea, „soluția" acceptă doar „==" și nu „=".
Amintește-ți că ai deja o sesiune SparkSession spark și o tabelă temporară people disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Filtrează tabela
peoplepentru a selecta toate rândurile unde sexul este „female" și salvează rezultatul în DataFrame-ulpeople_female_df. - Filtrează tabela
peoplepentru a selecta toate rândurile unde sexul este „male" și salvează rezultatul în DataFrame-ulpeople_male_df. - Numără rândurile din ambele DataFrame-uri,
people_femaleșipeople_male.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Filter the people table to select female sex
people_female_df = spark.____('SELECT * FROM ____ WHERE sex=="____"')
# Filter the people table DataFrame to select male sex
people_male_df = spark.____('SELECT * ____ people ____ ____=="____"')
# Count the number of rows in both people_df_female and people_male_df DataFrames
print("There are {} rows in the people_female_df and {} rows in the people_male_df DataFrames".format(people_female_df.____(), people_male_df.____()))