Фільтрування датафреймів pandas
Після вилучення даних із джерельної системи настає час їх трансформувати. Часто вихідні дані містять більше інформації, ніж потрібно для подальших сценаріїв використання. Якщо так, варто зменшити розмірність під час етапу «transform» конвеєра даних.
pandas імпортовано як pd, а функція extract() доступна для завантаження датафрейму зі шляху, який ви передаєте.
Ця вправа є частиною курсу
ETL та ELT у Python
Інструкції до вправи
- Використайте функцію
extract(), щоб завантажити датафрейм, збережений за шляхом"sales_data.parquet". - Оновіть функцію
transform(), щоб вона повертала всі рядки та стовпці з"Quantity Ordered"більшим за 1. - Додатково відфільтруйте датафрейм
clean_data, щоб залишити лише стовпці"Order Date","Quantity Ordered"і"Purchase Address". - Поверніть відфільтрований датафрейм.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)