Încărcarea fișierelor HTML pentru RAG
Documentele pot fi încărcate din multe formate diferite, inclusiv formate mai complexe precum HTML.
Dacă nu ești familiarizat cu HTML, acesta este un limbaj de marcare folosit pentru crearea paginilor web. Iată un exemplu simplu:
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
În acest exercițiu, vei încărca un fișier HTML care conține o pagină de blog de pe DataCamp. Clasele necesare au fost deja importate pentru tine.
Acest exercițiu face parte din cursul
Retrieval Augmented Generation (RAG) cu LangChain
Instrucțiuni pentru exercițiu
- Folosește clasa
UnstructuredHTMLLoaderpentru a încărca fișieruldatacamp-blog.htmldin directorul curent. - Încarcă documentele în memorie.
- Afișează conținutul paginii pentru primul document.
- Afișează metadatele primului document.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)