or
이 연습은 강의의 일부입니다
R로 배우는 자연어 처리 입문 1장은 텍스트에 대한 첫 분석을 실행할 준비를 합니다. 대부분의 분석 작업에서 가장 흔히 쓰이는 두 구성 요소인 정규 표현식과 토큰화를 살펴봅니다. 정규 표현식을 사용하면 떠올릴 수 있는 어떤 패턴이든 검색할 수 있고, 토큰화를 통해 더 정교한 분석을 위해 텍스트를 준비하고 정제할 수 있어요. 이 장은 이후 장에서 배울 기법을 다루기 위한 필수 기반이 됩니다.
이 장에서는 텍스트를 분석하는 데 가장 널리 쓰이고 연구된 방법을 학습합니다. 텍스트 코퍼스를 만들고, bag-of-words 표현을 TFIDF 행렬로 확장한 뒤, 코사인 유사도 지표를 사용해 두 텍스트가 서로 얼마나 비슷한지 판단해 봅니다. 이렇게 NLP 연습을 위한 기초를 다진 뒤 3장과 4장에서 NLP의 응용으로 들어갈 준비를 하게 됩니다.
현재 연습
3장에서는 텍스트 분석에서 흔히 쓰이는 두 가지 접근법, 분류 모델링과 토픽 모델링에 집중합니다. 텍스트 분석 프로젝트를 진행하다 보면 결국 이 방법들 중 하나 또는 둘 다를 사용하게 됩니다. 이 장에서는 두 기법을 수행하는 방법을 배우고, 실무적인 관점에서 이 기법들에 어떻게 접근할지에 대한 통찰도 제공합니다.
4장에서는 자연어 처리의 핵심인 감성 분석과 단어 임베딩을 다룹니다. 이는 텍스트 분석의 기초를 배우는 분들께 꼭 필요한 두 가지 기법입니다. 더불어 BERT, 품사 태깅, 개체명 인식에 대해서도 간단히 배웁니다. 이 과정에서는 거의 15가지에 달하는 분석 기법을 살펴보므로, 4장은 이 과정에서 배우게 될 뛰어난 기법들을 다시 정리하며 마무리합니다.