Моделирование набора данных о НЛО, часть 2
Наконец, вы построите модель на основе созданного текстового вектора desc_tfidf, используя список filtered_words для формирования отфильтрованного текстового вектора. Попробуйте предсказать тип (type) наблюдения по тексту описания. Для этого вы воспользуетесь моделью наивного Байеса.
Это упражнение является частью курса
Предобработка данных для машинного обучения на Python
Инструкции к упражнению
- Отфильтруйте вектор
desc_tfidf, передав списокfiltered_wordsв качестве индекса. - Разделите признаки
filtered_textи целевую переменнуюyна обучающую и тестовую выборки, обеспечив равномерное распределение классов; укажитеrandom_stateравным42. - С помощью метода
.fit()моделиnbобучите её на данныхX_trainиy_train. - Выведите значение
.score()моделиnbна выборкахX_testиy_test.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]
# Split the X and y sets using train_test_split, setting stratify=y
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)
# Fit nb to the training sets
____
# Print the score of nb on the test sets
____