Predikce příjmů filmů
Pusťme se do predikce příjmů filmů – začneme jednoduchou lineární regresí, která odhadne log-příjem filmů na základě příznaku 'budget'. Jako metriku použijeme RMSE (odmocninu střední kvadratické chyby). V scikit-learn ji spočítáš pomocí funkce mean_squared_error() z modulu sklearn.metrics a výsledek pak odmocníš pomocí numpy.
Dataset movies je už načtený a rozdělený na trénovací a testovací sadu. Chybějící hodnoty byly nahrazeny nulami a vstupní příznak byl standardizován pomocí StandardScaler(). Pokud se chceš dozvědět více o předzpracování dat pro Machine Learning, podívej se na kurzy DataCampu zaměřené na čištění dat a feature engineering.
Toto cvičení je součástí kurzu
Ensemble Methods in Python
Pokyny k cvičení
- Vytvoř instanci výchozího modelu
LinearRegression. - Vypočítej predikce na testovací sadě.
- Vypočítej RMSE. Funkce
mean_squared_error()přijímá dva argumenty:y_testa predikce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))