ПочатиПочніть безкоштовно

Витягування даних із parquet-файлів

Один із найпоширеніших способів отримувати дані з джерельної системи — читати їх із файла, наприклад CSV. Із зростанням обсягів даних виникла потреба в кращих форматах, що призвело до появи нових стовпцевих типів файлів, зокрема parquet.

У цій вправі ви попрактикуєтеся у витягуванні даних із parquet-файла.

Ця вправа є частиною курсу

ETL та ELT у Python

Переглянути курс

Інструкції до вправи

  • Зчитайте parquet-файл за шляхом "sales_data.parquet" у датафрейм pandas.
  • Перевірте типи даних датафрейму, скориставшись print().
  • Виведіть розмір датафрейму, а також його перші рядки.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

import pandas as pd

# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")

# Check the data type of the columns of the DataFrames
print(sales_data.____)

# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())
Редагувати та запускати код