НачатьНачать бесплатно

Фильтрация DataFrame в pandas

Когда данные извлечены из источника, наступает этап их преобразования! Исходные данные нередко содержат больше информации, чем требуется для дальнейшего использования. В таких случаях на этапе «transform» конвейера данных необходимо сократить размерность.

pandas импортирован как pd, а функция extract() доступна для загрузки DataFrame из указанного пути.

Это упражнение является частью курса

ETL и ELT на Python

Посмотреть курс

Инструкции к упражнению

  • Используйте функцию extract(), чтобы загрузить DataFrame из пути "sales_data.parquet".
  • Обновите функцию transform() так, чтобы она возвращала все строки и столбцы, где "Quantity Ordered" больше 1.
  • Дополнительно отфильтруйте DataFrame clean_data, оставив только столбцы "Order Date", "Quantity Ordered" и "Purchase Address".
  • Верните отфильтрованный DataFrame.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
Редактировать и запускать код