ÎncepețiÎncepe gratuit

Interogări SQL pentru filtrarea tabelelor

În exercițiul anterior, ai rulat o interogare SQL simplă pe un DataFrame. Poți construi interogări mai complexe pentru a obține rezultatele dorite și a le folosi în analize ulterioare, cum ar fi vizualizarea datelor și Machine Learning. În acest exercițiu, vei folosi tabela temporară people creată anterior, vei filtra rândurile în funcție de sexul „male" sau „female" și vei crea două DataFrame-uri.

Reține că „soluția" este sensibilă la majuscule în cazul comenzilor SQL (de exemplu, acceptă doar FROM, nu și from). De asemenea, „soluția" acceptă doar „==" și nu „=".

Amintește-ți că ai deja o sesiune SparkSession spark și o tabelă temporară people disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Filtrează tabela people pentru a selecta toate rândurile unde sexul este „female" și salvează rezultatul în DataFrame-ul people_female_df.
  • Filtrează tabela people pentru a selecta toate rândurile unde sexul este „male" și salvează rezultatul în DataFrame-ul people_male_df.
  • Numără rândurile din ambele DataFrame-uri, people_female și people_male.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Filter the people table to select female sex 
people_female_df = spark.____('SELECT * FROM ____ WHERE sex=="____"')

# Filter the people table DataFrame to select male sex
people_male_df = spark.____('SELECT * ____ people ____ ____=="____"')

# Count the number of rows in both people_df_female and people_male_df DataFrames
print("There are {} rows in the people_female_df and {} rows in the people_male_df DataFrames".format(people_female_df.____(), people_male_df.____()))
Editează și rulează codul