Моделювання набору даних про НЛО, частина 2
Нарешті ви побудуєте модель, використовуючи створений нами текстовий вектор desc_tfidf, а також список filtered_words, щоб сформувати відфільтрований текстовий вектор. Перевірмо, чи зможете ви передбачити type спостереження на основі тексту. Для цього ви використаєте наївний Байєсівський класифікатор.
Ця вправа є частиною курсу
Передобробка для машинного навчання в Python
Інструкції до вправи
- Відфільтруйте вектор
desc_tfidf, передавши до індексу списокfiltered_words. - Розбийте ознаки
filtered_textіy, забезпечивши однаковий розподіл класів у тренувальній та тестовій вибірках; використайтеrandom_stateзі значенням42. - Використайте
.fit()моделіnb, щоб натренуватиX_trainіy_train. - Виведіть
.score()моделіnbна вибіркахX_testтаy_test.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]
# Split the X and y sets using train_test_split, setting stratify=y
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)
# Fit nb to the training sets
____
# Print the score of nb on the test sets
____