Podsumowywanie długich tekstów
Streszczanie polega na skróceniu obszernego tekstu do zwięzłej formy, która pozwala szybko uchwycić najważniejsze informacje z długich artykułów lub dokumentów.
Wyróżniamy dwa główne typy: ekstrakcyjny, który wybiera kluczowe zdania z oryginalnego tekstu, oraz abstrakcyjny, który generuje nowe zdania ujmujące główne myśli.
W tym ćwiczeniu stworzysz abstrakcyjny potok streszczania przy użyciu funkcji pipeline() z biblioteki Hugging Face oraz modelu cnicu/t5-small-booksum. Podsumowanie obejmie tekst ze strony Wikipedii poświęconej Grecji – porównasz przeformułowane wyjście modelu abstrakcyjnego z oryginałem.
Funkcja pipeline z biblioteki transformers oraz zmienna original_text zostały już wczytane.
To ćwiczenie jest częścią kursu
Praca z Hugging Face
Instrukcje do ćwiczenia
- Utwórz potok streszczania
pipeline, używając zadania "summarization", i zapisz go jakosummarizer. - Użyj nowego potoku, aby wygenerować podsumowanie tekstu, i zapisz je jako
summary_text. - Porównaj długość oryginalnego tekstu z długością podsumowania.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create the summarization pipeline
summarizer = ____(____="____", model="cnicu/t5-small-booksum")
# Summarize the text
summary_text = ____(original_text)
# Compare the length
print(f"Original text length: {len(original_text)}")
print(f"Summary length: {len(____[0]['____'])}")