Завантаження HTML‑файлів для RAG
Документи можна завантажувати з багатьох різних форматів, зокрема з таких складних, як HTML.
Якщо ви не працювали з HTML, це мова розмітки для створення вебсторінок. Ось невеликий приклад:
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
У цій вправі ви завантажите HTML‑файл, що містить вебсторінку публікації блогу DataCamp. Необхідні класи вже імпортовано для вас.
Ця вправа є частиною курсу
Retrieval Augmented Generation (RAG) з LangChain
Інструкції до вправи
- Використайте клас
UnstructuredHTMLLoader, щоб завантажити файлdatacamp-blog.htmlу поточному каталозі. - Завантажте документи в памʼять.
- Виведіть вміст сторінки першого документа.
- Виведіть метадані першого документа.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)