Логистическая регрессия для диагностики рака молочной железы
В предыдущем упражнении вы провели первичный анализ данных. В этом упражнении вы определите обучающую и тестовую выборки для модели логистической регрессии на наборе данных о раке молочной железы. Это обязательный первый шаг перед запуском любой модели машинного обучения.
Набор данных о раке молочной железы — это пример набора из sklearn, содержащий различные признаки пациентов и целевую переменную, указывающую на наличие или отсутствие заболевания. Данные представлены в виде словаря: основные данные хранятся в массиве data, а целевые значения — в массиве target. Таким образом, cancer_data.data содержит признаки, а cancer_data.target — целевые значения. Набор данных загружен как cancer_data, библиотека pandas доступна как pd. Класс LogisticRegression импортирован из sklearn.linear_model.
Это упражнение является частью курса
Прогнозирование CTR с помощью машинного обучения на Python
Инструкции к упражнению
- Определите переменные
Xиy, используяdataиtargetсоответственно. - Присвойте
X_trainиy_trainпервые 300 элементовXиyсоответственно: дляX_trainиспользуйтеX[:300]. - Присвойте
X_testиy_testоставшиеся элементыXиyсоответственно (исключая первые 300): дляX_testиспользуйтеX[300:].
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]