Začněte nyníZačněte zdarma

Filtrování DataFramů v pandas

Jakmile jsou data extrahována ze zdrojového systému, přichází čas na jejich transformaci! Zdrojová data často obsahují více informací, než je pro další využití potřeba. V takovém případě je vhodné snížit dimenzionalitu dat ve fázi „transform" datového pipeline.

pandas je importován jako pd a funkce extract() je k dispozici pro načtení DataFrame z předané cesty.

Toto cvičení je součástí kurzu

ETL a ELT v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Pomocí funkce extract() načti DataFrame uložený na cestě "sales_data.parquet".
  • Uprav funkci transform() tak, aby vrátila všechny řádky a sloupce, kde je "Quantity Ordered" větší než 1.
  • Dále filtruj DataFrame clean_data tak, aby obsahoval pouze sloupce "Order Date", "Quantity Ordered" a "Purchase Address".
  • Vrať filtrovaný DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
Upravit a spustit kód