НачатьНачать бесплатно

Унитарное кодирование данных транзакций

На протяжении всего курса мы будем использовать единый конвейер предобработки данных для анализа рыночных корзин. Первый шаг — импортировать pandas DataFrame и выбрать столбец с транзакциями. Каждая транзакция в столбце представляет собой строку, содержащую несколько товаров, разделённых запятыми. Следующий шаг — применить lambda-функцию, чтобы разбить каждую строку транзакции на список, преобразовав столбец в список списков.

В этом упражнении вы начнёте работу со списком списков из набора данных о продуктовом магазине, который доступен вам как transactions. Затем вы преобразуете transactions в унитарно закодированный DataFrame, где каждый столбец содержит значения TRUE и FALSE, указывающие, входил ли товар в транзакцию.

Это упражнение является частью курса

Анализ рыночных корзин на Python

Посмотреть курс

Инструкции к упражнению

  • Из модуля mlxtend.preprocessing импортируйте TransactionEncoder.
  • Создайте экземпляр энкодера транзакций и определите уникальные товары в transactions.
  • Выполните унитарное кодирование transactions в массив и присвойте его значения переменной onehot.
  • Преобразуйте массив в pandas DataFrame, используя названия товаров в качестве заголовков столбцов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the transaction encoder function from mlxtend
from ____.____ import ____
import pandas as pd

# Instantiate transaction encoder and identify unique items in transactions
encoder = TransactionEncoder().____(____)

# One-hot encode transactions
onehot = encoder.____(transactions)

# Convert one-hot encoded data to DataFrame
onehot = pd.DataFrame(____, columns = encoder.columns_)

# Print the one-hot encoded transaction dataset
print(onehot)
Редактировать и запускать код