始める無料で始める

長文の要約

要約とは、長いテキストを簡潔にまとめる処理のことです。長い記事や文書の要点を素早く把握したいときに使用します。

要約には主に2種類の手法があります。抽出型は元のテキストから重要な文をそのまま抜き出す方法で、抽象型は重要な情報をもとに新しい文で要約を生成する方法です。

この演習では、Hugging Faceのpipeline()cnicu/t5-small-booksumモデルを使って、抽象型の要約パイプラインを構築します。ギリシャに関するWikipediaページのテキストを要約し、モデルが生成した要約文と原文を比較してみましょう。

transformersライブラリのpipelineoriginal_textはあらかじめ読み込まれています。

この演習はコースの一部です

Hugging Faceを使いこなす

コースを見る

演習の手順

  • タスクに"summarization"を指定して、要約用のpipelineを作成し、summarizerとして保存してください。
  • 作成したパイプラインを使ってテキストの要約を生成し、summary_textとして保存してください。
  • 元のテキストと要約テキストの長さを比較してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create the summarization pipeline
summarizer = ____(____="____", model="cnicu/t5-small-booksum")

# Summarize the text
summary_text = ____(original_text)

# Compare the length
print(f"Original text length: {len(original_text)}")
print(f"Summary length: {len(____[0]['____'])}")
コードを編集して実行