Загрузка HTML-файлов для RAG
Документы можно загружать из множества различных форматов, включая такие сложные, как HTML.
Если вы не знакомы с HTML, это язык разметки для создания веб-страниц. Вот небольшой пример:
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
В этом упражнении вы загрузите HTML-файл, содержащий страницу публикации из блога DataCamp. Необходимые классы уже импортированы.
Это упражнение является частью курса
Retrieval Augmented Generation (RAG) с LangChain
Инструкции к упражнению
- Используйте класс
UnstructuredHTMLLoader, чтобы загрузить файлdatacamp-blog.htmlиз текущего каталога. - Загрузите документы в память.
- Выведите содержимое первого документа.
- Выведите метаданные первого документа.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)