НачатьНачать бесплатно

Обучение модели логистической регрессии

После того как метки и признаки для данных подготовлены, можно приступить к обучению модели. В этой завершающей части упражнения вы разделите данные на обучающую и тестовую выборки, обучите модель логистической регрессии на обучающей выборке и проверите её точность.

Напомним, что в вашем рабочем пространстве доступны SparkContext sc и переменная samples.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Разделите объединённые данные на обучающую и тестовую выборки в соотношении 80:20.
  • Обучите модель логистической регрессии на обучающей выборке.
  • Получите предсказанные метки с помощью обученной модели на тестовой выборке.
  • Объедините метки тестовой выборки с предсказанными метками с помощью функции zip.
  • Вычислите точность обученной модели на основе исходных и предсказанных меток и выведите результат.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])

# Train the model
model = LogisticRegressionWithLBFGS.train(____)

# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))

# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)

# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))
Редактировать и запускать код