Extrahera data från parquet-filer
Ett av de vanligaste sätten att hämta in data från ett källsystem är att läsa data från en fil, till exempel en CSV-fil. I takt med att datamängderna har vuxit har behovet av effektivare filformat lett till nya kolumnorienterade filtyper, som parquet-filer.
I den här övningen får du öva på att extrahera data från en parquet-fil.
Den här övningen är en del av kursen
ETL och ELT i Python
Övningsinstruktioner
- Läs in parquet-filen på sökvägen
"sales_data.parquet"i enpandasDataFrame. - Kontrollera datatyperna i DataFramen med
print(). - Visa DataFramens dimensioner och dess första rader.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
import pandas as pd
# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")
# Check the data type of the columns of the DataFrames
print(sales_data.____)
# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())