НачатьНачать бесплатно

Логистическая регрессия для диагностики рака молочной железы

В предыдущем упражнении вы провели первичный анализ данных. В этом упражнении вы определите обучающую и тестовую выборки для модели логистической регрессии на наборе данных о раке молочной железы. Это обязательный первый шаг перед запуском любой модели машинного обучения.

Набор данных о раке молочной железы — это пример набора из sklearn, содержащий различные признаки пациентов и целевую переменную, указывающую на наличие или отсутствие заболевания. Данные представлены в виде словаря: основные данные хранятся в массиве data, а целевые значения — в массиве target. Таким образом, cancer_data.data содержит признаки, а cancer_data.target — целевые значения. Набор данных загружен как cancer_data, библиотека pandas доступна как pd. Класс LogisticRegression импортирован из sklearn.linear_model.

Это упражнение является частью курса

Прогнозирование CTR с помощью машинного обучения на Python

Посмотреть курс

Инструкции к упражнению

  • Определите переменные X и y, используя data и target соответственно.
  • Присвойте X_train и y_train первые 300 элементов X и y соответственно: для X_train используйте X[:300].
  • Присвойте X_test и y_test оставшиеся элементы X и y соответственно (исключая первые 300): для X_test используйте X[300:].

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Define X and y 
X = cancer_data.____
y = cancer_data.____

# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____] 
Редактировать и запускать код