CommencezCommencez gratuitement

Extraction de texte avec PyPDF

PyPDF permet d'extraire du texte de fichiers PDF, ce qui facilite le traitement de documents multipages comme des politiques internes.

Dans cet exercice, vous allez charger US_Employee_Policy.pdf, extraire son contenu page par page, puis le combiner en une seule chaîne de caractères afin de préparer le texte pour un pipeline de questions-réponses.

Cette activité fait partie du cours

Travailler avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Importez la classe requise depuis pypdf et utilisez-la pour charger le fichier PDF.
  • Accédez à chaque page et extrayez son contenu avec la méthode appropriée.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Modifier et exécuter le code