Een lineair model fitten
We gaan nu een lineair model fitten, omdat dat simpel en goed te begrijpen is. Nadat we het model hebben gefit, kunnen we zien welke voorspellers (predictor-variabelen) zinvol lineair gecorreleerd lijken met de target, en hoe groot hun effect op de target is. We beoordelen of voorspellers significant zijn op basis van de p-waarden van de coëfficiënten. Dit gebruikt een t-test om statistisch te toetsen of de coëfficiënt significant verschilt van 0. De p-waarde is de kans (in procenten) dat de coëfficiënt voor een feature niet afwijkt van nul. Meestal beschouwen we een p-waarde kleiner dan 0,05 als bewijs dat de coëfficiënt significant verschilt van 0.
Deze oefening maakt deel uit van de cursus
Machine Learning voor finance in Python
Oefeninstructies
- Fit het lineaire model (met de methode
.fit()) en sla de resultaten op in de variabeleresults. - Print de samenvatting van de resultaten met de functie
.summary(). - Print de p-waarden uit de resultaten (de eigenschap
.pvaluesvanresults). - Maak voorspellingen op basis van
train_featuresentest_featuresmet de functie.predict()van onsresults-object.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Create the linear model and complete the least squares fit
model = sm.OLS(train_targets, train_features)
results = model.____ # fit the model
print(results.____)
# examine pvalues
# Features with p <= 0.05 are typically considered significantly different from 0
print(results.____)
# Make predictions from our model for train and test sets
train_predictions = results.predict(train_features)
test_predictions = ____