在本练习中,您将对之前相同的 gettysburg 演讲文本执行词形还原。
gettysburg
不过这一次,您还将分别查看词形还原前后的演讲内容,并判断发生了哪些变化,从而让文本更适合机器处理。
本练习是课程的一部分
通过完成这段示例代码来试试这个练习。
# Print the gettysburg address print(____)
学习计算基础特征,如单词数、字符数、平均词长,以及特殊字符数量(例如 Twitter 话题标签与提及)。您还将学习计算可读性评分,并判断理解一段文本所需的受教育程度。
在本章中,您将学习分词和词形还原。随后,您将学习如何使用 spaCy 库进行文本清洗、词性标注和命名实体识别。掌握这些概念后,您将把《葛底斯堡演说》转换为机器可处理的格式,分析虚假新闻中的名词用法,并识别 TechCrunch 文章中提到的人物。
当前练习
学习 n-gram 建模,并将其用于对电影评论进行情感分析。
学习如何计算 tf-idf 权重以及两向量之间的余弦相似度。您将利用这些概念构建电影和 TED 演讲的推荐器。最后,您还将学习词嵌入,并使用词向量表示来计算多首 Pink Floyd 歌曲之间的相似度。