Фильтрация DataFrame в pandas
Когда данные извлечены из источника, наступает этап их преобразования! Исходные данные нередко содержат больше информации, чем требуется для дальнейшего использования. В таких случаях на этапе «transform» конвейера данных необходимо сократить размерность.
pandas импортирован как pd, а функция extract() доступна для загрузки DataFrame из указанного пути.
Это упражнение является частью курса
ETL и ELT на Python
Инструкции к упражнению
- Используйте функцию
extract(), чтобы загрузить DataFrame из пути"sales_data.parquet". - Обновите функцию
transform()так, чтобы она возвращала все строки и столбцы, где"Quantity Ordered"больше 1. - Дополнительно отфильтруйте DataFrame
clean_data, оставив только столбцы"Order Date","Quantity Ordered"и"Purchase Address". - Верните отфильтрованный DataFrame.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)