Förutsäga filmintäkter
Nu ska vi börja med utmaningen att förutsäga filmintäkter – och vi inleder med en enkel linjär regression för att uppskatta log-intäkten för filmer baserat på särdragen 'budget'. Måttet du använder här är RMSE (roten ur medelkvadratfelet). För att beräkna detta med scikit-learn kan du använda funktionen mean_squared_error() från modulen sklearn.metrics och sedan ta kvadratroten med numpy.
Datamängden movies har redan laddats in och delats upp i tränings- och testset. Saknade värden har ersatts med nollor och indatasärdragen har standardiserats med StandardScaler(). Ta gärna DataCamps kurser om datarensning och särdragsteknik om du vill lära dig mer om förbearbetning för maskininlärning.
Den här övningen är en del av kursen
Ensemblemetoder i Python
Övningsinstruktioner
- Instansiera standardmodellen
LinearRegression. - Beräkna prediktionerna på testsetet.
- Beräkna RMSE. Funktionen
mean_squared_error()kräver två argument:y_testföljt av prediktionerna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))