Bắt đầu ngayBắt đầu miễn phí

Kiểm tra tính chuẩn

Một bộ công cụ thống kê mạnh mẽ, bao gồm nhiều kiểm định giả thuyết phổ biến, dựa trên giả định rằng dữ liệu nền tuân theo phân phối chuẩn. Dù histogram có thể gợi ý dữ liệu xấp xỉ phân phối chuẩn hay không, các kiểm định giả thuyết khác nhau cho phép bạn kiểm tra trực tiếp giả định này. Hơn nữa, histogram rất nhạy với số lượng bins, đặc biệt khi cỡ mẫu nhỏ.

Trong bài tập này, bạn sẽ làm việc với dữ liệu lương của nhân viên Thành phố Austin trong salary_df. Cụ thể, bạn sẽ làm việc với các lính cứu hỏa gốc Hispanic. Bạn sẽ phân tích xem số năm làm việc của họ có xấp xỉ phân phối chuẩn hay không bằng kiểm định giả thuyết Anderson-Darling.

Bài tập này là một phần của khóa học

Nền tảng Suy luận trong Python

Xem khóa học

Hướng dẫn bài tập

  • Vẽ histogram hiển thị Years of Employment của các nhân viên.
  • Thực hiện kiểm định Anderson-Darling cho tính chuẩn để xem Years of Employment có xấp xỉ phân phối chuẩn hay không.
  • Tìm các critical_valuesstatistic của kiểm định lớn hơn.
  • In ra (các) significance_level tại đó giả thuyết không (null) sẽ bị bác bỏ.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()

# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)

# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)

# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])
Chỉnh sửa và Chạy Mã