Extraction de texte avec PyPDF
PyPDF permet d'extraire du texte de fichiers PDF, ce qui facilite le traitement de documents multipages comme des politiques internes.
Dans cet exercice, vous allez charger US_Employee_Policy.pdf, extraire son contenu page par page, puis le combiner en une seule chaîne de caractères afin de préparer le texte pour un pipeline de questions-réponses.
Cette activité fait partie du cours
Travailler avec Hugging Face
Instructions de l’exercice
- Importez la classe requise depuis
pypdfet utilisez-la pour charger le fichier PDF. - Accédez à chaque page et extrayez son contenu avec la méthode appropriée.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)