Kom igångKom igång gratis

Filtrera pandas DataFrames

När data har extraherats från ett källsystem är det dags att transformera den! Källdata innehåller ofta mer information än vad som behövs för nedströmsändamål. I sådana fall bör dimensionaliteten reduceras under transformationssteget i datapipelinen.

pandas har importerats som pd, och funktionen extract() finns tillgänglig för att läsa in en DataFrame från den sökväg som skickas in.

Den här övningen är en del av kursen

ETL och ELT i Python

Visa kurs

Övningsinstruktioner

  • Använd funktionen extract() för att läsa in den DataFrame som finns lagrad på sökvägen "sales_data.parquet".
  • Uppdatera funktionen transform() så att den returnerar alla rader och kolumner där "Quantity Ordered" är större än 1.
  • Filtrera sedan DataFrame:en clean_data ytterligare så att den bara innehåller kolumnerna "Order Date", "Quantity Ordered" och "Purchase Address".
  • Returnera den filtrerade DataFrame:en.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
Redigera och kör kod