Začněte nyníZačněte zdarma

Predikce příjmů filmů

Pusťme se do predikce příjmů filmů – začneme jednoduchou lineární regresí, která odhadne log-příjem filmů na základě příznaku 'budget'. Jako metriku použijeme RMSE (odmocninu střední kvadratické chyby). V scikit-learn ji spočítáš pomocí funkce mean_squared_error() z modulu sklearn.metrics a výsledek pak odmocníš pomocí numpy.

Dataset movies je už načtený a rozdělený na trénovací a testovací sadu. Chybějící hodnoty byly nahrazeny nulami a vstupní příznak byl standardizován pomocí StandardScaler(). Pokud se chceš dozvědět více o předzpracování dat pro Machine Learning, podívej se na kurzy DataCampu zaměřené na čištění dat a feature engineering.

Toto cvičení je součástí kurzu

Ensemble Methods in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř instanci výchozího modelu LinearRegression.
  • Vypočítej predikce na testovací sadě.
  • Vypočítej RMSE. Funkce mean_squared_error() přijímá dva argumenty: y_test a predikce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))
Upravit a spustit kód