Підігнання нормального розподілу
Коли ви працюєте з відносно невеликими наборами даних, часто бракує інформації для надійних висновків. Проте якщо ви припускаєте, що дані мають нормальний розподіл, доцільно підігнати нормальний розподіл і працювати з ним, а не з „сирими" даними. У цій вправі ви використовуватимете ті самі дані про латиноамериканських пожежників, для яких раніше було показано нормальність на рівні 5%. Ви підіжене́те до них нормальний розподіл і використаєте його, щоб знайти відсоток співробітників, у яких, як правило, очікується менше ніж 10 років стажу.
Цей датафрейм уже завантажено для вас у змінну salary_df. Пакети pandas як pd, NumPy як np, Matplotlib як plt і пакет stats із SciPy також уже імпортовано.
Ця вправа є частиною курсу
Основи інференції в Python
Інструкції до вправи
- Підіженіть нормальний розподіл до стовпця
Years of Employmentі збережіть отримані значення середнього та стандартного відхилення. - Використайте ці середнє та стандартне відхилення в нормальній CDF, щоб оцінити відсоток співробітників із менше ніж десятьма роками стажу.
- Виведіть цей відсоток за допомогою print.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Fit a normal distribution to the data
mu, std = ____
# Compute the percentage of employees with less than 10 years experience
percent = stats.____(____, loc=____, scale=____)
# Print out this percentage
____