Extragerea textului cu PyPDF
PyPDF ne permite să extragem text din fișiere PDF, simplificând lucrul cu documente de mai multe pagini, precum fișierele de politici.
În acest exercițiu, vei încărca fișierul US_Employee_Policy.pdf, vei extrage conținutul pagină cu pagină și îl vei combina într-un singur șir de caractere, pregătind textul pentru un pipeline de răspuns la întrebări.
Acest exercițiu face parte din cursul
Lucrul cu Hugging Face
Instrucțiuni pentru exercițiu
- Importă clasa necesară din
pypdfși folosește-o pentru a încărca fișierul PDF. - Accesează fiecare pagină și extrage conținutul acesteia folosind metoda corectă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)