Организация транскрибированных данных телефонных звонков
Мы почти готовы построить классификатор текста. Но пока все транскрибированные данные хранятся в двух списках: pre_purchase_text и post_purchase_text.
Чтобы упорядочить их для построения классификатора и дальнейшего использования, мы объединим данные в DataFrame pandas.
Для начала импортируем pandas как pd, затем создадим DataFrame для данных после покупки — post_purchase_df — с помощью pd.DataFrame().
В pd.DataFrame() передадим словарь с ключом "label" со значением "post_purchase" и ключом "text" со значением списка post_purchase_text.
Аналогичным образом создадим pre_purchase_df, используя список pre_purchase_text.
Чтобы собрать все данные в одном месте, воспользуемся pd.concat() и передадим в него оба DataFrame.
Это упражнение является частью курса
Обработка устной речи на Python
Инструкции к упражнению
- Создайте
post_purchase_dfна основе спискаpost_purchase_text. - Создайте
pre_purchase_dfна основе спискаpre_purchase_text. - Объедините два DataFrame с помощью
pd.concat().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())