Začněte nyníZačněte zdarma

SQL dotazy pro filtrování tabulky

V předchozím cvičení jsi spustil/a jednoduchý SQL dotaz na DataFrame. Existují i sofistikovanější dotazy, pomocí kterých získáš přesně ta data, která potřebuješ – třeba pro vizualizaci dat nebo Machine Learning. V tomto cvičení použijeme dočasnou tabulku people, kterou jsi vytvořil/a dříve, odfiltrujeme řádky podle hodnoty „sex" (male a female) a vytvoříme dva DataFramy.

Pozor: „řešení" rozlišuje velká a malá písmena u SQL příkazů (například akceptuje pouze FROM, nikoli from). „Řešení" také akceptuje pouze „==" a nikoli „=".

Nezapomeň, že v pracovním prostředí máš k dispozici SparkSession spark a dočasnou tabulku people.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Filtruj tabulku people a vyber všechny řádky, kde je sex female, do DataFrame people_female_df.
  • Filtruj tabulku people a vyber všechny řádky, kde je sex male, do DataFrame people_male_df.
  • Spočítej počet řádků v obou DataFramech people_female a people_male.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Filter the people table to select female sex 
people_female_df = spark.____('SELECT * FROM ____ WHERE sex=="____"')

# Filter the people table DataFrame to select male sex
people_male_df = spark.____('SELECT * ____ people ____ ____=="____"')

# Count the number of rows in both people_df_female and people_male_df DataFrames
print("There are {} rows in the people_female_df and {} rows in the people_male_df DataFrames".format(people_female_df.____(), people_male_df.____()))
Upravit a spustit kód