Creează un clasificator de text din limbaj vorbit
Acum că ai transcris câteva date audio din apelurile clienților, vom construi un model care să clasifice textul dintr-un apel ca fiind pre_purchase sau post_purchase.
Avem 45 de exemple de apeluri pre_purchase și 57 de exemple de apeluri post_purchase.
Datele pe care modelul le va folosi pentru antrenament sunt stocate în train_df, iar datele pe care le va folosi pentru predicții sunt stocate în test_df.
Încearcă să afișezi .head() al fiecăruia în consolă.
Vom construi un sklearn pipeline folosind CountVectorizer() și TfidfTransformer() pentru a converti eșantioanele de text în valori numerice, apoi vom folosi un clasificator MultinomialNB() pentru a determina categoria fiecărui eșantion.
Acest model va funcționa bine pentru exemplul nostru de dimensiuni reduse, însă pentru cantități mai mari de text poate că vei dori să iei în considerare ceva mai sofisticat.
Acest exercițiu face parte din cursul
Procesarea limbajului vorbit în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
('vectorizer', ____),
('tfidf', ____),
('classifier', ____),
])
# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)