लंबे टेक्स्ट का सारांश
सारांशण बड़े टेक्स्ट को संक्षिप्त और सुगम कंटेंट में बदल देता है, जिससे पाठक लंबे आर्टिकल या डॉक्यूमेंट से मुख्य बिंदु जल्दी समझ पाते हैं.
दो मुख्य प्रकार होते हैं: extractive, जो मूल टेक्स्ट से अहम वाक्यों का चयन करता है, और abstractive, जो मुख्य विचारों का नया, अपने शब्दों में सार लिखता है.
इस अभ्यास में, आप Hugging Face के pipeline() फंक्शन और cnicu/t5-small-booksum मॉडल का उपयोग करके एक abstractive summarization pipeline बनाएँगे. आप ग्रीस पर एक Wikipedia पेज से टेक्स्ट का सारांश बनाएँगे और abstractive मॉडल के पुनर्लिखित आउटपुट की तुलना मूल टेक्स्ट से करेंगे.
transformers लाइब्रेरी का pipeline फंक्शन और original_text आपके लिए पहले से लोड कर दिए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ काम करना
अभ्यास निर्देश
- "summarization" टास्क का उपयोग करके summarization
pipelineबनाएँ और उसेsummarizerनाम से सेव करें. - नए pipeline का उपयोग करके टेक्स्ट का सारांश बनाएँ और उसे
summary_textके रूप में सेव करें. - मूल और सारांश टेक्स्ट की लंबाई की तुलना करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create the summarization pipeline
summarizer = ____(____="____", model="cnicu/t5-small-booksum")
# Summarize the text
summary_text = ____(original_text)
# Compare the length
print(f"Original text length: {len(original_text)}")
print(f"Summary length: {len(____[0]['____'])}")