Построение и оценка модели: данные отзывов о товарах
В этом упражнении вы построите логистическую регрессию на основе набора данных reviews, содержащего отзывы покупателей о товарах Amazon. Массив y содержит метки тональности: 1 — положительный отзыв, 0 — в противном случае. Массив X содержит все числовые признаки, созданные с помощью подхода «мешок слов» (BOW). Вы можете изучить их в оболочке IPython.
Ваша задача — построить модель логистической регрессии и вычислить точность, а также матрицу ошибок на тестовой выборке.
Функции логистической регрессии и разбивки данных на обучающую и тестовую выборки уже импортированы.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте функции расчёта точности и матрицы ошибок.
- Разделите данные на обучающую и тестовую выборки, выделив 30% данных для тестирования, и установите случайное зерно равным
42. - Обучите модель логистической регрессии.
- Выведите значение точности и матрицу ошибок, используя тестовые данные.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the accuracy and confusion matrix
____
# Split the data into training and testing
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.3, ____=42)
# Build a logistic regression
log_reg = ____._____
# Predict the labels
y_predict = log_reg.predict(X_test)
# Print the performance metrics
print('Accuracy score of test data: ', ____(____, ____))
print('Confusion matrix of test data: \n', ____(____, ____)/len(y_test))