셰익스피어 문어체 전처리 파이프라인
PyBooks 팀은 대규모 셰익스피어 텍스트 데이터를 후속 분석에 활용할 수 있도록 변환하려고 해요. 가장 효율적인 방법은 전처리 단계부터 시작하는 텍스트 처리 파이프라인을 구축하는 거예요.
다음 항목들이 미리 로드되어 있어요:
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
셰익스피어 텍스트 데이터는 shakespeare로 저장되어 있으며, 문장은 이미 추출되어 있어요.
이 연습은 강의의 일부입니다
PyTorch로 배우는 텍스트 딥러닝
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a list of stopwords
stop_words = set(____(____))