Organiser les données de conversations téléphoniques transcrites
Nous sommes presque prêts à construire un classificateur de texte. Pour l'instant, toutefois, toutes nos transcriptions se trouvent dans deux listes, pre_purchase_text et post_purchase_text.
Pour mieux les organiser en vue de l'entraînement du classificateur et pour un usage futur, nous allons tout rassembler dans un DataFrame pandas.
Pour commencer, importez pandas sous le nom pd, puis créez un DataFrame post-achat, post_purchase_df, à l'aide de pd.DataFrame().
Nous allons passer à pd.DataFrame() un dictionnaire contenant une clé "label" avec la valeur "post_purchase" et une clé "text" avec comme valeur notre liste post_purchase_text.
Faites la même chose pour pre_purchase_df, mais avec pre_purchase_text.
Pour avoir toutes les données au même endroit, utilisez pd.concat() en lui passant les DataFrames pre et post achat.
Cette activité fait partie du cours
Traitement de la langue parlée en Python
Instructions de l’exercice
- Créez
post_purchase_dfà partir de la listepost_purchase_text. - Créez
pre_purchase_dfà partir de la listepre_purchase_text. - Combinez les deux DataFrames avec
pd.concat().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())