CommencezCommencez gratuitement

Organiser les données de conversations téléphoniques transcrites

Nous sommes presque prêts à construire un classificateur de texte. Pour l'instant, toutefois, toutes nos transcriptions se trouvent dans deux listes, pre_purchase_text et post_purchase_text.

Pour mieux les organiser en vue de l'entraînement du classificateur et pour un usage futur, nous allons tout rassembler dans un DataFrame pandas.

Pour commencer, importez pandas sous le nom pd, puis créez un DataFrame post-achat, post_purchase_df, à l'aide de pd.DataFrame().

Nous allons passer à pd.DataFrame() un dictionnaire contenant une clé "label" avec la valeur "post_purchase" et une clé "text" avec comme valeur notre liste post_purchase_text.

Faites la même chose pour pre_purchase_df, mais avec pre_purchase_text.

Pour avoir toutes les données au même endroit, utilisez pd.concat() en lui passant les DataFrames pre et post achat.

Cette activité fait partie du cours

Traitement de la langue parlée en Python

Voir le cours

Instructions de l’exercice

  • Créez post_purchase_df à partir de la liste post_purchase_text.
  • Créez pre_purchase_df à partir de la liste pre_purchase_text.
  • Combinez les deux DataFrames avec pd.concat().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

import pandas as pd

# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
                                 "text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
                                "text": ____})

# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])

# Print the combined DataFrame
print(df.head())
Modifier et exécuter le code