데이터 전처리
이제 다중 클래스 분류에서 데이터를 전처리하는 방법의 차이를 배웠어요. 간단한 다중 클래스 분류 모델을 만들기 전에, 전처리를 직접 해 보겠습니다.
데이터셋은 변수 news_dataset에 로드되어 있으며, 다음 속성을 가집니다:
news_dataset.data: 텍스트 배열news_dataset.target: 숫자 인덱스로 표현한 타깃 범주 배열
샘플 데이터에는 5,000개의 관측치가 있습니다.
이 연습은 강의의 일부입니다
Keras로 배우는 언어 모델링을 위한 순환 신경망(RNN)
연습 안내
tokenizer변수에Tokenizer클래스를 인스턴스화하세요.- 텍스트 데이터에
tokenizer를 학습(fit)하세요. - 텍스트 데이터에
.texts_to_sequences()메서드를 사용하세요. - 타깃 인덱스를 준비하기 위해
to_categorical()함수를 사용하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)