ПочатиПочніть безкоштовно

Навчання моделі Logistic Regression

Після створення міток і ознак для даних ми готові будувати модель, яка зможе на них навчатися. Але перш ніж навчати модель, у цій завершальній частині вправи ви розіб'єте дані на тренувальні та тестові, запустите модель Logistic Regression на тренувальних даних і, нарешті, перевірите точність моделі, натренованої на тренувальній вибірці.

Пам'ятайте, у вашому середовищі доступний SparkContext sc, а також змінна samples.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Розбийте об'єднані дані на тренувальний і тестовий набори у співвідношенні 80:20.
  • Навчіть модель Logistic Regression на тренувальному наборі даних.
  • Створіть передбачені мітки за допомогою натренованої моделі на тестовому наборі даних.
  • Поєднайте мітки з тестового набору з мітками з набору передбачень за допомогою функції zip.
  • Обчисліть точність натренованої моделі, використавши початкові та передбачені мітки, і виведіть її.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])

# Train the model
model = LogisticRegressionWithLBFGS.train(____)

# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))

# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)

# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))
Редагувати та запускати код