Dopasowywanie modelu regresji liniowej
Anonimowa ankieta płacowa jest przeprowadzana corocznie od 2015 roku wśród europejskich specjalistów IT. W 2018 roku setki respondentów zdecydowało się wziąć w niej udział. Dane z ankiety zawierają informacje o liczbie lat doświadczenia respondentów oraz ich aktualnym wynagrodzeniu.
Przeanalizujesz zależność między tymi dwiema zmiennymi, aby sprawdzić, czy większe doświadczenie wiąże się z wyższym czy niższym wynagrodzeniem.
Zmienna niezależna to experience_years, a zmienna zależna to current_salary.
Dane zostały wczytane jako data, a biblioteki statsmodels.api i pandas są dostępne odpowiednio jako sm i pd.
To ćwiczenie jest częścią kursu
Analiza danych ankietowych w Pythonie
Instrukcje do ćwiczenia
- Zdefiniuj zmienne
xiy. - Dodaj wyraz wolny (stałą).
- Przeprowadź regresję
OLS()i dopasuj model metodą.fit(). - Wydrukuj tabelę podsumowania.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define variable, x and y
x = salary_survey.____.____
y = salary_survey.____.____
# Add the constant term
x = ____.____(x)
# Perform .OLS() regression and fit
result = ____.____(y,x).____()
# Print the summary table
print(____.____())