Začněte nyníZačněte zdarma

Trénování modelu logistické regrese

Teď, když máš připravené štítky a příznaky, je čas sestavit model, který se z dat naučí (trénování). Nejdřív ale data rozdělíš na trénovací a testovací sadu, spustíš logistickou regresi na trénovacích datech a nakonec ověříš přesnost natrénovaného modelu.

V pracovním prostředí máš k dispozici SparkContext sc a také proměnnou samples.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Rozděl sloučená data na trénovací a testovací sadu v poměru 80:20.
  • Natrénuj model logistické regrese na trénovací sadě.
  • Vytvoř předpovědní štítky pomocí natrénovaného modelu na testovací sadě.
  • Zkombinuj štítky z testovací sady se štítky z předpovědní sady pomocí funkce zip.
  • Vypočítej přesnost natrénovaného modelu na základě původních a předpovězených štítků a výsledek vypiš.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])

# Train the model
model = LogisticRegressionWithLBFGS.train(____)

# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))

# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)

# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))
Upravit a spustit kód