Подгонка нормального распределения
При работе с относительно небольшими наборами данных зачастую не хватает наблюдений для обоснованных выводов. Однако если есть основания полагать, что данные подчиняются нормальному распределению, разумно подогнать его к данным и работать с ним, а не с исходными значениями. В этом упражнении вы будете работать с теми же данными о пожарных латиноамериканского происхождения, для которых ранее показали нормальность распределения на уровне значимости 5%. Вы подгоните к ним нормальное распределение и используете его, чтобы оценить долю сотрудников, стаж которых, как правило, составляет менее 10 лет.
Данный DataFrame загружен для вас в переменной salary_df. Пакеты pandas как pd, NumPy как np, Matplotlib как plt, а также модуль stats из SciPy уже импортированы.
Это упражнение является частью курса
Основы статистического вывода на Python
Инструкции к упражнению
- Подгоните нормальное распределение к столбцу
Years of Employmentи сохраните полученные среднее значение и стандартное отклонение. - Используйте эти параметры в функции нормального CDF, чтобы оценить долю сотрудников со стажем менее десяти лет.
- Выведите это значение на экран.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Fit a normal distribution to the data
mu, std = ____
# Compute the percentage of employees with less than 10 years experience
percent = stats.____(____, loc=____, scale=____)
# Print out this percentage
____