Načítání HTML souborů pro RAG
Dokumenty lze načítat z celé řady formátů, včetně těch složitějších, jako je HTML.
Pokud HTML neznáš, jde o značkovací jazyk pro tvorbu webových stránek. Tady je malý příklad:
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
V tomto cvičení načteš HTML soubor s příspěvkem z blogu DataCamp. Potřebné třídy už jsou za tebe naimportované.
Toto cvičení je součástí kurzu
Retrieval Augmented Generation (RAG) with LangChain
Pokyny k cvičení
- Pomocí třídy
UnstructuredHTMLLoadernačti soubordatacamp-blog.htmlz aktuálního adresáře. - Načti dokumenty do paměti.
- Vypiš obsah stránky prvního dokumentu.
- Vypiš metadata prvního dokumentu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)