Обучение модели логистической регрессии
После того как метки и признаки для данных подготовлены, можно приступить к обучению модели. В этой завершающей части упражнения вы разделите данные на обучающую и тестовую выборки, обучите модель логистической регрессии на обучающей выборке и проверите её точность.
Напомним, что в вашем рабочем пространстве доступны SparkContext sc и переменная samples.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Разделите объединённые данные на обучающую и тестовую выборки в соотношении 80:20.
- Обучите модель логистической регрессии на обучающей выборке.
- Получите предсказанные метки с помощью обученной модели на тестовой выборке.
- Объедините метки тестовой выборки с предсказанными метками с помощью функции
zip. - Вычислите точность обученной модели на основе исходных и предсказанных меток и выведите результат.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])
# Train the model
model = LogisticRegressionWithLBFGS.train(____)
# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))
# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)
# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))