Filtrarea DataFrame-urilor pandas
Odată ce datele au fost extrase dintr-un sistem sursă, este timpul să le transformăm! Adesea, datele sursă pot conține mai multe informații decât sunt necesare pentru utilizările ulterioare. În acest caz, dimensionalitatea ar trebui redusă în faza de „transformare" a pipeline-ului de date.
pandas a fost importat ca pd, iar funcția extract() este disponibilă pentru a încărca un DataFrame din calea transmisă.
Acest exercițiu face parte din cursul
ETL și ELT în Python
Instrucțiuni pentru exercițiu
- Folosește funcția
extract()pentru a încărca DataFrame-ul stocat la calea"sales_data.parquet". - Actualizează funcția
transform()pentru a returna toate rândurile și coloanele cu"Quantity Ordered"mai mare decât 1. - Filtrează în continuare DataFrame-ul
clean_datapentru a include doar coloanele"Order Date","Quantity Ordered"și"Purchase Address". - Returnează DataFrame-ul filtrat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)