ÎncepețiÎncepe gratuit

Filtrarea DataFrame-urilor pandas

Odată ce datele au fost extrase dintr-un sistem sursă, este timpul să le transformăm! Adesea, datele sursă pot conține mai multe informații decât sunt necesare pentru utilizările ulterioare. În acest caz, dimensionalitatea ar trebui redusă în faza de „transformare" a pipeline-ului de date.

pandas a fost importat ca pd, iar funcția extract() este disponibilă pentru a încărca un DataFrame din calea transmisă.

Acest exercițiu face parte din cursul

ETL și ELT în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește funcția extract() pentru a încărca DataFrame-ul stocat la calea "sales_data.parquet".
  • Actualizează funcția transform() pentru a returna toate rândurile și coloanele cu "Quantity Ordered" mai mare decât 1.
  • Filtrează în continuare DataFrame-ul clean_data pentru a include doar coloanele "Order Date", "Quantity Ordered" și "Purchase Address".
  • Returnează DataFrame-ul filtrat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
Editează și rulează codul