शुरू करेंमुफ़्त में शुरू करें

PyPDF के साथ टेक्स्ट एक्सट्रैक्ट करना

PyPDF हमें PDFs से टेक्स्ट निकालने देता है, जिससे पॉलिसी फ़ाइलों जैसे मल्टी-पेज डॉक्यूमेंट्स पर काम करना आसान हो जाता है.

इस अभ्यास में, आप US_Employee_Policy.pdf लोड करेंगे, उसका कंटेंट पेज-दर-पेज एक्सट्रैक्ट करेंगे, और उसे एक सिंगल स्ट्रिंग में जोड़ेंगे, ताकि टेक्स्ट को एक क्वेश्चन-आंसरिंग पाइपलाइन के लिए तैयार किया जा सके.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Hugging Face के साथ काम करना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pypdf से आवश्यक क्लास इम्पोर्ट करें और उसका उपयोग करके PDF फ़ाइल लोड करें.
  • हर पेज तक पहुँचें और सही मेथड का उपयोग करके उसका कंटेंट एक्सट्रैक्ट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
कोड संपादित करें और चलाएँ