Začněte nyníZačněte zdarma

Načítání HTML souborů pro RAG

Dokumenty lze načítat z celé řady formátů, včetně těch složitějších, jako je HTML.

Pokud HTML neznáš, jde o značkovací jazyk pro tvorbu webových stránek. Tady je malý příklad:

<!DOCTYPE html>
<html>
<body>
  <h2>Heading</h2>
  <p>Here's some text and an image below:</p>
  <img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>

V tomto cvičení načteš HTML soubor s příspěvkem z blogu DataCamp. Potřebné třídy už jsou za tebe naimportované.

Toto cvičení je součástí kurzu

Retrieval Augmented Generation (RAG) with LangChain

Zobrazit kurz

Pokyny k cvičení

  • Pomocí třídy UnstructuredHTMLLoader načti soubor datacamp-blog.html z aktuálního adresáře.
  • Načti dokumenty do paměti.
  • Vypiš obsah stránky prvního dokumentu.
  • Vypiš metadata prvního dokumentu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a document loader for unstructured HTML
loader = ____

# Load the document
data = ____

# Print the first document's content
print(____)

# Print the first document's metadata
print(____)
Upravit a spustit kód