НачатьНачать бесплатно

Моделирование набора данных о НЛО, часть 2

Наконец, вы построите модель на основе созданного текстового вектора desc_tfidf, используя список filtered_words для формирования отфильтрованного текстового вектора. Попробуйте предсказать тип (type) наблюдения по тексту описания. Для этого вы воспользуетесь моделью наивного Байеса.

Это упражнение является частью курса

Предобработка данных для машинного обучения на Python

Посмотреть курс

Инструкции к упражнению

  • Отфильтруйте вектор desc_tfidf, передав список filtered_words в качестве индекса.
  • Разделите признаки filtered_text и целевую переменную y на обучающую и тестовую выборки, обеспечив равномерное распределение классов; укажите random_state равным 42.
  • С помощью метода .fit() модели nb обучите её на данных X_train и y_train.
  • Выведите значение .score() модели nb на выборках X_test и y_test.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]

# Split the X and y sets using train_test_split, setting stratify=y 
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)

# Fit nb to the training sets
____

# Print the score of nb on the test sets
____
Редактировать и запускать код