摘要長篇文字
摘要能把大量文字濃縮成精簡內容,協助讀者快速抓住長篇文章或文件的重點。
常見有兩種類型:抽取式會從原文中挑選關鍵句子;生成式則會用新的句子來概括主要想法。
在這個練習中,你會使用 Hugging Face 的 pipeline() 函式與 cnicu/t5-small-booksum 模型,建立一個生成式摘要 pipeline。你將對希臘的 Wikipedia 文章進行摘要,並比較生成式模型改寫後的輸出與原文的差異。
transformers 函式庫中的 pipeline 函式,以及 original_text,都已為你載入完成。
本練習屬於課程
善用 Hugging Face
練習說明
- 使用任務 "summarization" 建立摘要用的
pipeline,並存成summarizer。 - 使用這個新的 pipeline 產生文字摘要,並存成
summary_text。 - 比較原文與摘要文字的長度。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create the summarization pipeline
summarizer = ____(____="____", model="cnicu/t5-small-booksum")
# Summarize the text
summary_text = ____(original_text)
# Compare the length
print(f"Original text length: {len(original_text)}")
print(f"Summary length: {len(____[0]['____'])}")