Crea un classificatore di testo per il linguaggio parlato
Ora che hai trascritto alcuni audio delle chiamate dei clienti, costruiremo un modello per classificare se il testo della chiamata è pre_purchase o post_purchase.
Abbiamo 45 esempi di chiamate pre_purchase e 57 esempi di chiamate post_purchase.
I dati su cui il modello si allenerà sono salvati in train_df e i dati su cui il modello effettuerà le previsioni sono salvati in test_df.
Prova a stampare a console il .head() di ciascuno dei due.
Creeremo una pipeline di sklearn usando CountVectorizer() e TfidfTransformer() per convertire i nostri esempi di testo in numeri e poi useremo un classificatore MultinomialNB() per imparare a quale categoria appartiene ogni campione.
Questo modello funzionerà bene nel nostro piccolo esempio, ma per quantità di testo maggiori potresti voler considerare qualcosa di più sofisticato.
Questo esercizio fa parte del corso
Elaborazione del linguaggio parlato in Python
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
('vectorizer', ____),
('tfidf', ____),
('classifier', ____),
])
# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)