CommencezCommencez gratuitement

Créer un classificateur de texte issu de la langue parlée

Maintenant que vous avez transcrit des extraits audio d'appels clients, nous allons bâtir un modèle pour classer si le texte de l'appel est pre_purchase ou post_purchase.

Nous avons 45 exemples d'appels pre_purchase et 57 exemples d'appels post_purchase.

Les données utilisées pour entraîner le modèle sont stockées dans train_df et celles sur lesquelles le modèle fera des prédictions sont dans test_df.

Essayez d'afficher .head() pour chacun de ces DataFrames dans la console.

Nous allons construire un sklearn pipeline avec CountVectorizer() et TfidfTransformer() pour convertir nos échantillons de texte en valeurs numériques, puis utiliser un classificateur MultinomialNB() pour apprendre à quelle catégorie appartient chaque échantillon.

Ce modèle fonctionnera bien pour notre petit exemple, mais pour de plus grands volumes de texte, vous voudrez peut‑être envisager une approche plus évoluée.

Cette activité fait partie du cours

Traitement de la langue parlée en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
Modifier et exécuter le code