Kom igångKom igång gratis

Skapa en textklassificerare för talat språk

Nu när du har transkriberat en del kundtjänstaudio ska vi bygga en modell för att klassificera om texten från kundsamtalet är pre_purchase eller post_purchase.

Vi har 45 exempel på pre_purchase-samtal och 57 exempel på post_purchase-samtal.

Datan som modellen tränas på finns i train_df och datan som modellen ska göra förutsägelser på finns i test_df.

Testa att skriva ut .head() för varje DataFrame i konsolen.

Vi bygger en sklearn pipeline med CountVectorizer() och TfidfTransformer() för att konvertera våra textexempel till tal, och använder sedan en MultinomialNB()-klassificerare för att lära modellen vilken kategori varje exempel tillhör.

Modellen fungerar bra för det här lilla exemplet, men för större mängder text kan det vara värt att överväga något mer avancerat.

Den här övningen är en del av kursen

Taligenkänning i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
Redigera och kör kod