НачатьНачать бесплатно

Разбиение файлов Python на части

Хотя текстовые и программные файлы содержат одни и те же символы, код имеет структуры, которых нет в естественном языке. Чтобы сохранить этот контекст при разбиении документов, нужно настроить сплиттер так, чтобы он в первую очередь разбивал текст по наиболее распространённым структурам кода. К счастью, LangChain предоставляет именно такую возможность!

Все необходимые классы уже импортированы, включая Language из langchain_text_splitters.

Это упражнение является частью курса

Retrieval Augmented Generation (RAG) с LangChain

Посмотреть курс

Инструкции к упражнению

  • Создайте рекурсивный символьный сплиттер, который будет разбивать текст по типичным структурам кода Python.
  • Разбейте загрузчик документов python_data на фрагменты.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a Python-aware recursive character splitter
python_splitter = RecursiveCharacterTextSplitter.____(
    ____, chunk_size=300, chunk_overlap=100
)

# Split the Python content into chunks
chunks = ____

for i, chunk in enumerate(chunks[:3]):
    print(f"Chunk {i+1}:\n{chunk.page_content}\n")
Редактировать и запускать код