Filtrování DataFramů v pandas
Jakmile jsou data extrahována ze zdrojového systému, přichází čas na jejich transformaci! Zdrojová data často obsahují více informací, než je pro další využití potřeba. V takovém případě je vhodné snížit dimenzionalitu dat ve fázi „transform" datového pipeline.
pandas je importován jako pd a funkce extract() je k dispozici pro načtení DataFrame z předané cesty.
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Pokyny k cvičení
- Pomocí funkce
extract()načti DataFrame uložený na cestě"sales_data.parquet". - Uprav funkci
transform()tak, aby vrátila všechny řádky a sloupce, kde je"Quantity Ordered"větší než 1. - Dále filtruj DataFrame
clean_datatak, aby obsahoval pouze sloupce"Order Date","Quantity Ordered"a"Purchase Address". - Vrať filtrovaný DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)