Zacznij terazZacznij za darmo

Wyodrębnianie danych z plików parquet

Jednym z najczęstszych sposobów pobierania danych ze źródłowego systemu jest odczyt danych z pliku, na przykład pliku CSV. Wraz ze wzrostem ilości danych pojawiła się potrzeba lepszych formatów plików – stąd powstały kolumnowe typy plików, takie jak pliki parquet.

W tym ćwiczeniu przećwiczysz wyodrębnianie danych z pliku parquet.

To ćwiczenie jest częścią kursu

ETL i ELT w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj plik parquet znajdujący się pod ścieżką "sales_data.parquet" do DataFrame biblioteki pandas.
  • Sprawdź typy danych w DataFrame, wyświetlając je za pomocą print().
  • Wyświetl kształt DataFrame oraz jego pierwsze wiersze.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

import pandas as pd

# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")

# Check the data type of the columns of the DataFrames
print(sales_data.____)

# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())
Edytuj i uruchom kod