or
本練習屬於課程
自然語言處理入門的第 1 章會帶你完成第一個文字分析。你將探索正規表示式與斷詞(tokenization),這是多數分析任務中最常見的兩個元件。透過正規表示式,你能搜尋任何你想到的模式;透過斷詞,你能為更進一步的分析準備並清理文字。本章是之後各章學習技術的必要基礎。
在本章中,你將學習最常見、研究最深入的文字分析方法。你會建立文字語料庫,將詞袋(bag-of-words)表示法擴展為 TFIDF 矩陣,並使用餘弦相似度來判定兩段文字之間的相似程度。你會在進入第 3 與第 4 章的 NLP 應用之前,進一步鞏固練習 NLP 的基礎。
當前練習
第 3 章聚焦於兩種常見的文字分析方法:分類建模與主題模型。當你進行文字分析專案時,幾乎一定會用到其中一種或兩種方法。本章會教你如何實作這兩種技巧,並從實務角度提供如何運用這些方法的洞見。
第 4 章將介紹自然語言處理中的兩項重要方法:情感分析與詞向量嵌入。對於學習文字分析基礎的人而言,這兩種技術都不可或缺。此外,你還會簡要認識 BERT、詞性標註(part-of-speech tagging)與命名實體辨識。本課程共涵蓋近 15 種分析技術,因此第 4 章最後會回顧你在課程中將學到的重點技巧。