Zacznij terazZacznij za darmo

Filtrowanie DataFrames w pandas

Gdy dane zostaną wyodrębnione ze źródłowego systemu, czas je przekształcić! Dane źródłowe często zawierają więcej informacji, niż jest potrzebne w dalszych zastosowaniach. W takim przypadku należy zredukować ich wymiarowość na etapie „transform" potoku danych.

pandas został zaimportowany jako pd, a funkcja extract() jest dostępna i służy do wczytania DataFrame ze ścieżki podanej jako argument.

To ćwiczenie jest częścią kursu

ETL i ELT w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj funkcji extract(), aby wczytać DataFrame zapisany pod ścieżką "sales_data.parquet".
  • Zaktualizuj funkcję transform() tak, aby zwracała wszystkie wiersze i kolumny, w których wartość "Quantity Ordered" jest większa niż 1.
  • Przefiltruj DataFrame clean_data tak, aby zawierał tylko kolumny "Order Date", "Quantity Ordered" i "Purchase Address".
  • Zwróć przefiltrowany DataFrame.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
Edytuj i uruchom kod