Унитарное кодирование данных транзакций
На протяжении всего курса мы будем использовать единый конвейер предобработки данных для анализа рыночных корзин. Первый шаг — импортировать pandas DataFrame и выбрать столбец с транзакциями. Каждая транзакция в столбце представляет собой строку, содержащую несколько товаров, разделённых запятыми. Следующий шаг — применить lambda-функцию, чтобы разбить каждую строку транзакции на список, преобразовав столбец в список списков.
В этом упражнении вы начнёте работу со списком списков из набора данных о продуктовом магазине, который доступен вам как transactions. Затем вы преобразуете transactions в унитарно закодированный DataFrame, где каждый столбец содержит значения TRUE и FALSE, указывающие, входил ли товар в транзакцию.
Это упражнение является частью курса
Анализ рыночных корзин на Python
Инструкции к упражнению
- Из модуля
mlxtend.preprocessingимпортируйтеTransactionEncoder. - Создайте экземпляр энкодера транзакций и определите уникальные товары в
transactions. - Выполните унитарное кодирование
transactionsв массив и присвойте его значения переменнойonehot. - Преобразуйте массив в
pandasDataFrame, используя названия товаров в качестве заголовков столбцов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the transaction encoder function from mlxtend
from ____.____ import ____
import pandas as pd
# Instantiate transaction encoder and identify unique items in transactions
encoder = TransactionEncoder().____(____)
# One-hot encode transactions
onehot = encoder.____(transactions)
# Convert one-hot encoded data to DataFrame
onehot = pd.DataFrame(____, columns = encoder.columns_)
# Print the one-hot encoded transaction dataset
print(onehot)