Extrakce dat z parquet souborů
Jedním z nejběžnějších způsobů, jak načíst data ze zdrojového systému, je čtení ze souboru – například CSV. S rostoucím objemem dat vznikla potřeba efektivnějších formátů, a tak přišly sloupcově orientované typy souborů, jako jsou parquet soubory.
V tomto cvičení si procvičíš extrakci dat z parquet souboru.
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Pokyny k cvičení
- Načti parquet soubor z cesty
"sales_data.parquet"do DataFramupandas. - Pomocí
print()vypiš datové typy sloupců DataFramu. - Zobraz tvar DataFramu a jeho prvních několik řádků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
import pandas as pd
# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")
# Check the data type of the columns of the DataFrames
print(sales_data.____)
# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())