or
本练习是课程的一部分
本课程第 1 章将带您完成首次文本分析的准备工作。您将学习正则表达式和分词,这两项是大多数分析任务中最常见的组成部分。通过正则表达式,您可以搜索几乎任意的模式;借助分词,您可以为更复杂的分析准备并清洗文本。本章为后续章节中的技术打下必要基础。
在本章中,您将学习最常见、研究最充分的文本分析方法。您将看到如何创建文本语料库,将词袋表示扩展为 TF-IDF 矩阵,并使用余弦相似度来判断两段文本之间的相似程度。您将在前两者的基础上进一步巩固 NLP 实操能力,然后在第 3 章和第 4 章进入 NLP 的应用。
第 3 章聚焦两种常见的文本分析方法:分类建模和主题建模。如果您从事文本分析项目,几乎一定会用到其中一种或两种方法。本章将教您如何实施这两类技术,并从实践角度提供相应的思路与指南。
当前练习
第 4 章将介绍自然语言处理中的两项常用方法:情感分析和词向量。这两种分析技术是学习文本分析基础时不可或缺的内容。此外,您还将简要了解 BERT、词性标注和命名实体识别。本课程共涵盖近 15 种分析技术,因此第 4 章最后会对您在本课程中学到的重点方法进行回顾总结。