НачатьНачать бесплатно

Подгонка нормального распределения

При работе с относительно небольшими наборами данных зачастую не хватает наблюдений для обоснованных выводов. Однако если есть основания полагать, что данные подчиняются нормальному распределению, разумно подогнать его к данным и работать с ним, а не с исходными значениями. В этом упражнении вы будете работать с теми же данными о пожарных латиноамериканского происхождения, для которых ранее показали нормальность распределения на уровне значимости 5%. Вы подгоните к ним нормальное распределение и используете его, чтобы оценить долю сотрудников, стаж которых, как правило, составляет менее 10 лет.

Данный DataFrame загружен для вас в переменной salary_df. Пакеты pandas как pd, NumPy как np, Matplotlib как plt, а также модуль stats из SciPy уже импортированы.

Это упражнение является частью курса

Основы статистического вывода на Python

Посмотреть курс

Инструкции к упражнению

  • Подгоните нормальное распределение к столбцу Years of Employment и сохраните полученные среднее значение и стандартное отклонение.
  • Используйте эти параметры в функции нормального CDF, чтобы оценить долю сотрудников со стажем менее десяти лет.
  • Выведите это значение на экран.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Fit a normal distribution to the data
mu, std = ____

# Compute the percentage of employees with less than 10 years experience
percent = stats.____(____, loc=____, scale=____)

# Print out this percentage
____
Редактировать и запускать код