Začněte nyníZačněte zdarma

Extrakce textu pomocí PyPDF

PyPDF umožňuje extrahovat text z PDF souborů, takže práce s vícestránkovými dokumenty, jako jsou například firemní směrnice, je snadná.

V tomto cvičení načteš soubor US_Employee_Policy.pdf, extrahuješ jeho obsah stránku po stránce a spojíš ho do jednoho řetězce – tím připravíš text pro pipeline pro zodpovídání otázek.

Toto cvičení je součástí kurzu

Working with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Importuj potřebnou třídu z pypdf a použij ji k načtení PDF souboru.
  • Přistup k jednotlivým stránkám a extrahuj jejich obsah pomocí správné metody.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Upravit a spustit kód