Ladda HTML-filer för RAG
Det går att ladda dokument från många olika format, inklusive komplexa format som HTML.
Om du inte är bekant med HTML är det ett märkspråk för att skapa webbsidor. Här är ett litet exempel:
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
I den här övningen laddar du en HTML-fil som innehåller ett blogginlägg från DataCamp. De klasser du behöver har redan importerats åt dig.
Den här övningen är en del av kursen
Retrieval Augmented Generation (RAG) med LangChain
Övningsinstruktioner
- Använd klassen
UnstructuredHTMLLoaderför att ladda filendatacamp-blog.htmli den aktuella katalogen. - Ladda dokumenten till minnet.
- Skriv ut sidinnehållet för det första dokumentet.
- Skriv ut metadata för det första dokumentet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)