Przewidywanie przychodów filmów
Zacznijmy wyzwanie polegające na przewidywaniu przychodów filmów – zbudujemy prostą regresję liniową, która oszacuje logarytm przychodów na podstawie cechy 'budget'. Jako metryki użyjemy RMSE (pierwiastek błędu średniokwadratowego). Aby obliczyć ją za pomocą scikit-learn, skorzystaj z funkcji mean_squared_error() z modułu sklearn.metrics, a następnie wyciągnij pierwiastek kwadratowy przy użyciu numpy.
Zbiór danych movies został wczytany i podzielony na zbiory treningowy oraz testowy. Brakujące wartości zostały zastąpione zerami, a cecha wejściowa znormalizowana przy użyciu StandardScaler(). Jeśli chcesz dowiedzieć się więcej o preprocessingu w uczeniu maszynowym, zapoznaj się z kursami DataCamp dotyczącymi czyszczenia danych i inżynierii cech.
To ćwiczenie jest częścią kursu
Metody zespołowe w Pythonie
Instrukcje do ćwiczenia
- Utwórz instancję domyślnego modelu
LinearRegression. - Oblicz prognozy na zbiorze testowym.
- Oblicz RMSE. Funkcja
mean_squared_error()przyjmuje dwa argumenty:y_test, a następnie prognozy.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))