Упорядкування транскрибованих даних телефонних дзвінків
Ми майже готові будувати текстовий класифікатор. Але зараз усі наші транскрибовані текстові дані зберігаються у двох списках: pre_purchase_text і post_purchase_text.
Щоб краще їх упорядкувати для побудови класифікатора та подальшого використання, зберемо їх у датафрейм pandas.
Спочатку імпортуємо pandas як pd, потім створимо датафрейм після покупки — post_purchase_df за допомогою pd.DataFrame().
Ми передамо pd.DataFrame() словник із ключем "label" зі значенням "post_purchase" та ключем "text" зі значенням нашого списку post_purchase_text.
Зробимо те саме для pre_purchase_df, але з pre_purchase_text.
Щоб мати всі дані в одному місці, скористаємося pd.concat() і передамо йому датафрейми для періоду до та після покупки.
Ця вправа є частиною курсу
Обробка усного мовлення в Python
Інструкції до вправи
- Створіть
post_purchase_dfз використанням спискуpost_purchase_text. - Створіть
pre_purchase_dfз використанням спискуpre_purchase_text. - Об'єднайте два датафрейми за допомогою
pd.concat().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())