长文本摘要
摘要可以把大段文本压缩为更易消化的内容,帮助读者快速把握长篇文章或文档的要点。
常见有两种方式:抽取式会从原文中挑选关键句;生成式会生成新的句子来概括核心思想。
在本练习中,您将使用 Hugging Face 的 pipeline() 函数与 cnicu/t5-small-booksum 模型,创建一个生成式文本摘要流水线。您将对一篇关于希腊的维基百科页面文本进行摘要,并把生成式模型的改写结果与原文进行对比。
transformers 库中的 pipeline 函数以及 original_text 已为您加载完毕。
本练习是课程的一部分
使用 Hugging Face
练习说明
- 使用任务 "summarization" 创建摘要
pipeline,并保存为summarizer。 - 使用新建的流水线对文本生成摘要,并保存为
summary_text。 - 比较原文与摘要文本的长度。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create the summarization pipeline
summarizer = ____(____="____", model="cnicu/t5-small-booksum")
# Summarize the text
summary_text = ____(original_text)
# Compare the length
print(f"Original text length: {len(original_text)}")
print(f"Summary length: {len(____[0]['____'])}")