Витягування даних із parquet-файлів
Один із найпоширеніших способів отримувати дані з джерельної системи — читати їх із файла, наприклад CSV. Із зростанням обсягів даних виникла потреба в кращих форматах, що призвело до появи нових стовпцевих типів файлів, зокрема parquet.
У цій вправі ви попрактикуєтеся у витягуванні даних із parquet-файла.
Ця вправа є частиною курсу
ETL та ELT у Python
Інструкції до вправи
- Зчитайте parquet-файл за шляхом
"sales_data.parquet"у датафреймpandas. - Перевірте типи даних датафрейму, скориставшись
print(). - Виведіть розмір датафрейму, а також його перші рядки.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
import pandas as pd
# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")
# Check the data type of the columns of the DataFrames
print(sales_data.____)
# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())