ПочатиПочніть безкоштовно

Створіть класифікатор тексту усного мовлення

Тепер, коли ви транскрибували деякі аудіодані клієнтських дзвінків, збудуємо модель, яка визначатиме, чи належить текст із дзвінка до pre_purchase чи до post_purchase.

Маємо 45 прикладів дзвінків pre_purchase і 57 прикладів post_purchase.

Дані для тренування моделі зберігаються в train_df, а дані для передбачення — в test_df.

Спробуйте вивести в консоль .head() для кожного з них.

Ми створимо sklearn pipeline, використовуючи CountVectorizer() та TfidfTransformer() для перетворення зразків тексту на числа, а потім застосуємо класифікатор MultinomialNB(), щоб навчитися визначати, до якої категорії належить кожен зразок.

Ця модель добре спрацює на нашому невеликому прикладі, але для більших обсягів тексту варто розглянути щось складніше.

Ця вправа є частиною курсу

Обробка усного мовлення в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
Редагувати та запускати код