Классификатор текста устной речи
Теперь, когда вы расшифровали аудиозаписи звонков клиентов, построим модель для классификации текста: определим, относится ли звонок к категории pre_purchase или post_purchase.
В нашем распоряжении 45 примеров звонков категории pre_purchase и 57 примеров категории post_purchase.
Данные для обучения модели хранятся в train_df, а данные для предсказаний — в test_df.
Попробуйте вывести .head() каждого из этих датафреймов в консоль.
Мы построим конвейер sklearn pipeline, используя CountVectorizer() и TfidfTransformer() для преобразования текстовых примеров в числа, а затем применим классификатор MultinomialNB(), чтобы определить категорию каждого примера.
Для небольшого набора данных эта модель работает хорошо, однако при работе с большими объёмами текста стоит рассмотреть более сложные подходы.
Это упражнение является частью курса
Обработка устной речи на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
('vectorizer', ____),
('tfidf', ____),
('classifier', ____),
])
# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)