長文の要約
要約とは、長いテキストを簡潔にまとめる処理のことです。長い記事や文書の要点を素早く把握したいときに使用します。
要約には主に2種類の手法があります。抽出型は元のテキストから重要な文をそのまま抜き出す方法で、抽象型は重要な情報をもとに新しい文で要約を生成する方法です。
この演習では、Hugging Faceのpipeline()とcnicu/t5-small-booksumモデルを使って、抽象型の要約パイプラインを構築します。ギリシャに関するWikipediaページのテキストを要約し、モデルが生成した要約文と原文を比較してみましょう。
transformersライブラリのpipelineとoriginal_textはあらかじめ読み込まれています。
この演習はコースの一部です
Hugging Faceを使いこなす
演習の手順
- タスクに"summarization"を指定して、要約用の
pipelineを作成し、summarizerとして保存してください。 - 作成したパイプラインを使ってテキストの要約を生成し、
summary_textとして保存してください。 - 元のテキストと要約テキストの長さを比較してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create the summarization pipeline
summarizer = ____(____="____", model="cnicu/t5-small-booksum")
# Summarize the text
summary_text = ____(original_text)
# Compare the length
print(f"Original text length: {len(original_text)}")
print(f"Summary length: {len(____[0]['____'])}")