Вычисление целевой переменной по событию
=======
Вы организуете благотворительное мероприятие и хотите предсказать, кто из доноров с наибольшей вероятностью на него придёт. Похожее мероприятие уже проводилось ранее, и эти данные можно использовать для построения предсказательной модели. Вам даны список population с уникальными идентификаторами доноров для этой базовой таблицы и список attend_event с донорами из выборки, которые посетили прошлое мероприятие.
В этом упражнении вы построите базовую таблицу с двумя столбцами: donor_id и target, где target равен 1, если донор посетил мероприятие, и 0 в противном случае.
Это упражнение является частью курса
Средний уровень прогностической аналитики на Python
Инструкции к упражнению
- Создайте pandas DataFrame
basetableс одной строкой для каждого донора из спискаpopulationи одним столбцомdonor_id, содержащим идентификатор донора. - Добавьте целевую переменную в виде столбца в
basetable. Значение целевой переменной равно 1, если донор посетил мероприятие, и 0 в противном случае. - Вычислите и выведите на экран долю целевых наблюдений, то есть количество строк, в которых целевая переменная равна 1, делённое на общее количество строк в
basetable.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Basetable with one column: donor_id
basetable = pd.DataFrame(____, columns=["____"])
# Add target to the basetable
basetable["target"] = pd.Series([____ if donor_id in ____ else ____ for donor_id in basetable["donor_id"]])
# Calculate and print the target incidence
print(round(____["____"].sum() / len(____), 2))