영화 리뷰의 확률 예측하기
이 문제에서는 movies 데이터셋으로 로지스틱 회귀를 구축해 보겠습니다. 레이블은 배열 y에, 특성은 X에 저장되어 있어요.
학습 데이터로 모델을 학습하세요. 클래스를 직접 예측하는 대신, 테스트 세트의 각 샘플이 두 클래스 각각에 속할 확률을 예측하세요.
로지스틱 회귀와 train/test 분할 함수는 이미 임포트되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
연습 안내
- 데이터를 학습용과 테스트용으로 분할하세요.
- 로지스틱 회귀 모델을 학습하세요.
- 테스트 데이터에 대해 클래스 0과 클래스 1의 확률을 예측하세요. 예측된 확률에서 클래스 0은 첫 번째 열, 클래스 1은 두 번째 열에 위치합니다.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Split into training and testing
X_train, X_test, y_train, y_test = ____(___, ___, test_size=0.2, random_state=321)
# Train a logistic regression
log_reg = ____.____
# Predict the probability of the 0 class
prob_0 = log_reg.____[:, ____]
# Predict the probability of the 1 class
prob_1 = log_reg.____[:, ____]
print("First 10 predicted probabilities of class 0: ", prob_0[:10])
print("First 10 predicted probabilities of class 1: ", prob_1[:10])