Wyodrębnianie danych z plików parquet
Jednym z najczęstszych sposobów pobierania danych ze źródłowego systemu jest odczyt danych z pliku, na przykład pliku CSV. Wraz ze wzrostem ilości danych pojawiła się potrzeba lepszych formatów plików – stąd powstały kolumnowe typy plików, takie jak pliki parquet.
W tym ćwiczeniu przećwiczysz wyodrębnianie danych z pliku parquet.
To ćwiczenie jest częścią kursu
ETL i ELT w Pythonie
Instrukcje do ćwiczenia
- Wczytaj plik parquet znajdujący się pod ścieżką
"sales_data.parquet"do DataFrame bibliotekipandas. - Sprawdź typy danych w DataFrame, wyświetlając je za pomocą
print(). - Wyświetl kształt DataFrame oraz jego pierwsze wiersze.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
import pandas as pd
# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")
# Check the data type of the columns of the DataFrames
print(sales_data.____)
# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())