Extrakce textu pomocí PyPDF
PyPDF umožňuje extrahovat text z PDF souborů, takže práce s vícestránkovými dokumenty, jako jsou například firemní směrnice, je snadná.
V tomto cvičení načteš soubor US_Employee_Policy.pdf, extrahuješ jeho obsah stránku po stránce a spojíš ho do jednoho řetězce – tím připravíš text pro pipeline pro zodpovídání otázek.
Toto cvičení je součástí kurzu
Working with Hugging Face
Pokyny k cvičení
- Importuj potřebnou třídu z
pypdfa použij ji k načtení PDF souboru. - Přistup k jednotlivým stránkám a extrahuj jejich obsah pomocí správné metody.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)