Извлечение данных из parquet-файлов
Один из самых распространённых способов получить данные из исходной системы — прочитать их из файла, например CSV. По мере роста объёмов данных возникла потребность в более эффективных форматах, что привело к появлению столбцово-ориентированных типов файлов, в частности parquet.
В этом упражнении вы потренируетесь извлекать данные из parquet-файла.
Это упражнение является частью курса
ETL и ELT на Python
Инструкции к упражнению
- Прочитайте parquet-файл по пути
"sales_data.parquet"в DataFramepandas. - Выведите типы данных DataFrame с помощью
print(). - Выведите размерность DataFrame, а также его первые строки.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
import pandas as pd
# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")
# Check the data type of the columns of the DataFrames
print(sales_data.____)
# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())