Kom igångKom igång gratis

Extrahera text med PyPDF

Med PyPDF kan du extrahera text från PDF-filer, vilket gör det enkelt att arbeta med flersidiga dokument som policyfiler.

I den här övningen laddar du US_Employee_Policy.pdf, extraherar innehållet sida för sida och slår samman det till en enda sträng – redo att användas i en fråga-och-svar-pipeline.

Den här övningen är en del av kursen

Arbeta med Hugging Face

Visa kurs

Övningsinstruktioner

  • Importera den klass som krävs från pypdf och använd den för att läsa in PDF-filen.
  • Hämta varje sida och extrahera dess innehåll med rätt metod.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Redigera och kör kod