ÎncepețiÎncepe gratuit

Antrenarea modelului de Regresie Logistică

După ce am creat etichetele și caracteristicile pentru date, suntem pregătiți să construim un model care să învețe din ele (antrenament). Înainte de a antrena modelul, în această ultimă parte a exercițiului, vei împărți datele în seturi de antrenament și de testare, vei rula modelul de Regresie Logistică pe datele de antrenament și vei verifica acuratețea modelului antrenat.

Reține că ai la dispoziție un SparkContext sc în spațiul de lucru, precum și variabila samples.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Împarte datele combinate în seturi de antrenament și de testare în raport de 80:20.
  • Antrenează modelul de Regresie Logistică cu setul de antrenament.
  • Creează o etichetă de predicție folosind modelul antrenat aplicat pe setul de testare.
  • Combină etichetele din setul de testare cu etichetele din setul de predicție folosind funcția zip.
  • Calculează acuratețea modelului antrenat pe baza etichetelor originale și a celor prezise, apoi afișeaz-o.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])

# Train the model
model = LogisticRegressionWithLBFGS.train(____)

# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))

# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)

# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))
Editează și rulează codul