Zacznij terazZacznij za darmo

Testowanie normalności

Wiele zaawansowanych narzędzi statystycznych – w tym szereg popularnych testów hipotez – opiera się na założeniu, że dane mają rozkład normalny. Histogram może sugerować, czy dane są mniej więcej normalnie rozłożone, ale to testy hipotez pozwalają zweryfikować to założenie bezpośrednio. Poza tym histogramy są bardzo wrażliwe na liczbę przedziałów (binów), szczególnie przy małych próbkach.

W tym ćwiczeniu będziesz pracować z danymi o wynagrodzeniach pracowników miasta Austin, zapisanymi w salary_df. Skupisz się na pracownikach straży pożarnej identyfikujących się jako Latynosi. Sprawdzisz, czy staż pracy tych osób ma w przybliżeniu rozkład normalny – za pomocą testu Andersona-Darlinga.

To ćwiczenie jest częścią kursu

Podstawy wnioskowania statystycznego w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wykreśl histogram przedstawiający kolumnę Years of Employment dla pracowników.
  • Przeprowadź test Andersona-Darlinga, aby sprawdzić, czy Years of Employment ma w przybliżeniu rozkład normalny.
  • Sprawdź, które wartości critical_values są mniejsze od statystyki testowej statistic.
  • Wyświetl poziom(-y) istotności significance_level, przy których hipoteza zerowa zostałaby odrzucona.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()

# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)

# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)

# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])
Edytuj i uruchom kod