Natrénování lineárního modelu
Teď natrénujeme lineární model – je jednoduchý a snadno pochopitelný. Po natrénování uvidíme, které prediktory mají smysluplnou lineární korelaci s cílovou proměnnou a jak velký vliv na ni mají. To, zda je prediktor statisticky významný, posuzujeme pomocí p-hodnot koeficientů. Ty vycházejí z t-testu, který ověřuje, zda se koeficient statisticky významně liší od 0. P-hodnota udává pravděpodobnost, že koeficient daného příznaku se od nuly ve skutečnosti neliší. Obecně platí, že p-hodnota nižší než 0,05 znamená, že koeficient se od 0 statisticky významně liší.
Toto cvičení je součástí kurzu
Machine Learning for Finance in Python
Pokyny k cvičení
- Natrénuj lineární model (pomocí metody
.fit()) a výsledky ulož do proměnnéresults. - Vypiš souhrnné výsledky pomocí funkce
.summary(). - Vypiš p-hodnoty z výsledků (vlastnost
.pvaluesobjekturesults). - Vytvoř předpovědi z
train_featuresatest_featurespomocí funkce.predict()objekturesults.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create the linear model and complete the least squares fit
model = sm.OLS(train_targets, train_features)
results = model.____ # fit the model
print(results.____)
# examine pvalues
# Features with p <= 0.05 are typically considered significantly different from 0
print(results.____)
# Make predictions from our model for train and test sets
train_predictions = results.predict(train_features)
test_predictions = ____