ÎncepețiÎncepe gratuit

Extragerea textului cu PyPDF

PyPDF ne permite să extragem text din fișiere PDF, simplificând lucrul cu documente de mai multe pagini, precum fișierele de politici.

În acest exercițiu, vei încărca fișierul US_Employee_Policy.pdf, vei extrage conținutul pagină cu pagină și îl vei combina într-un singur șir de caractere, pregătind textul pentru un pipeline de răspuns la întrebări.

Acest exercițiu face parte din cursul

Lucrul cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa necesară din pypdf și folosește-o pentru a încărca fișierul PDF.
  • Accesează fiecare pagină și extrage conținutul acesteia folosind metoda corectă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Editează și rulează codul