НачатьНачать бесплатно

Классификатор текста устной речи

Теперь, когда вы расшифровали аудиозаписи звонков клиентов, построим модель для классификации текста: определим, относится ли звонок к категории pre_purchase или post_purchase.

В нашем распоряжении 45 примеров звонков категории pre_purchase и 57 примеров категории post_purchase.

Данные для обучения модели хранятся в train_df, а данные для предсказаний — в test_df.

Попробуйте вывести .head() каждого из этих датафреймов в консоль.

Мы построим конвейер sklearn pipeline, используя CountVectorizer() и TfidfTransformer() для преобразования текстовых примеров в числа, а затем применим классификатор MultinomialNB(), чтобы определить категорию каждого примера.

Для небольшого набора данных эта модель работает хорошо, однако при работе с большими объёмами текста стоит рассмотреть более сложные подходы.

Это упражнение является частью курса

Обработка устной речи на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
Редактировать и запускать код