Filtrowanie DataFrames w pandas
Gdy dane zostaną wyodrębnione ze źródłowego systemu, czas je przekształcić! Dane źródłowe często zawierają więcej informacji, niż jest potrzebne w dalszych zastosowaniach. W takim przypadku należy zredukować ich wymiarowość na etapie „transform" potoku danych.
pandas został zaimportowany jako pd, a funkcja extract() jest dostępna i służy do wczytania DataFrame ze ścieżki podanej jako argument.
To ćwiczenie jest częścią kursu
ETL i ELT w Pythonie
Instrukcje do ćwiczenia
- Użyj funkcji
extract(), aby wczytać DataFrame zapisany pod ścieżką"sales_data.parquet". - Zaktualizuj funkcję
transform()tak, aby zwracała wszystkie wiersze i kolumny, w których wartość"Quantity Ordered"jest większa niż 1. - Przefiltruj DataFrame
clean_datatak, aby zawierał tylko kolumny"Order Date","Quantity Ordered"i"Purchase Address". - Zwróć przefiltrowany DataFrame.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)