Comece agoraComece grátis

Crie um classificador de texto de linguagem falada

Agora que você transcreveu alguns trechos de áudio de chamadas de clientes, vamos construir um modelo para classificar se o texto da chamada do cliente é pre_purchase ou post_purchase.

Temos 45 exemplos de chamadas pre_purchase e 57 exemplos de chamadas post_purchase.

Os dados nos quais o modelo vai treinar estão em train_df e os dados nos quais o modelo vai prever estão em test_df.

Tente imprimir o .head() de cada um deles no console.

Vamos construir um sklearn pipeline usando CountVectorizer() e TfidfTransformer() para transformar nossas amostras de texto em números e depois usar um classificador MultinomialNB() para aprender a qual categoria cada amostra pertence.

Este modelo funciona bem no nosso exemplo pequeno aqui, mas, para quantidades maiores de texto, você pode considerar algo mais sofisticado.

Este exercicio faz parte do curso

Processamento de Linguagem Falada em Python

Ver curso

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
Editar e Executar Código