or
이 연습은 강의의 일부입니다
단어 수, 문자 수, 평균 단어 길이, 특수 문자 수(예: 트위터 해시태그와 멘션) 같은 기본 피처를 계산하는 방법을 배워요. 또한 가독성 점수를 계산하고, 한 텍스트를 이해하는 데 필요한 교육 수준을 추정하는 방법도 익힙니다.
이 장에서는 토크나이즈와 표제어 추출(레mmatization)을 학습해요. 이어서 spaCy 라이브러리를 사용해 텍스트 클리닝, 품사(POS) 태깅, 개체명 인식(NER)을 수행하는 방법을 배웁니다. 개념을 익힌 뒤에는 게티즈버그 연설을 기계가 읽기 쉽게 변환하고, 가짜 뉴스에서 명사 사용을 분석하며, TechCrunch 기사에 언급된 인물을 식별해 볼 거예요.
현재 연습
n-gram 모델링을 배우고 이를 활용해 영화 리뷰의 감성 분석을 수행해요.
tf-idf 가중치와 두 벡터 사이의 코사인 유사도 점수를 계산하는 방법을 배워요. 이를 바탕으로 영화와 TED Talk 추천기를 만들어 봅니다. 마지막으로 워드 임베딩을 학습하고, 단어 벡터 표현을 사용해 다양한 Pink Floyd 노래 간의 유사도를 계산해 봐요.