如何在 LangChain 文档检索链中控制上下文 Token 数量

碧海醫心

碧海醫心

2026-07-25

798人浏览

原创

如何在 LangChain 文档检索链中控制上下文 Token 数量

本文介绍在 langchain 0.1.9 环境下,通过预处理文档分块与动态上下文裁剪相结合的方式,有效规避大模型上下文长度超限(如 openai 的 8192 token 限制)问题,确保检索增强对话链稳定运行。

本文介绍在 langchain 0.1.9 环境下,通过预处理文档分块与动态上下文裁剪相结合的方式,有效规避大模型上下文长度超限(如 openai 的 8192 token 限制)问题,确保检索增强对话链稳定运行。

在使用 create_retrieval_chain 构建 RAG(检索增强生成)对话系统时,一个常见但易被忽视的瓶颈是:检索返回的文档片段过大,导致拼接后 Context 超出 LLM 的最大上下文窗口(例如 gpt-3.5-turbo-16k 实际受限于 prompt + context + response 总 token 数)。你遇到的 context_length_exceeded 错误,根源往往不在链路逻辑本身,而在于向量库中存储的文档粒度不合理——将整篇长文档(如 PDF 全文、日志文件)未经切分直接嵌入,导致单次检索返回数 KB 甚至 MB 级别的 page_content,远超 token 预算。

✅ 根本解法:前置文档分块(Chunking),而非链中截断

LangChain 的 create_retrieval_chain 及其配套组件(如 create_stuff_documents_chain)不提供内置的 token 截断机制,也不支持对 context 字段做动态 token 限长(尤其在 0.1.9 版本中,ReduceDocumentsChain 和 ConversationalRetrievalChain 均已弃用或不兼容 ChatOpenAI)。因此,最稳健、高效且符合设计哲学的方案是:在文档入库前完成语义合理、长度可控的分块(chunking)

推荐使用 CharacterTextSplitter(适用于通用文本)或更智能的 RecursiveCharacterTextSplitter(优先按段落/句子切分):

from langchain.text_splitter import RecursiveCharacterTextSplitter

def chunk_document(text: str, chunk_size: int = 800, chunk_overlap: int = 80) -> list:
    text_splitter = RecursiveCharacterTextSplitter(
        separators=["\n\n", "\n", " ", ""],  # 优先按空行、换行、空格切分
        chunk_size=chunk_size,
        chunk_overlap=chunk_overlap,
        length_function=len
    )
    return text_splitter.split_text(text)

# ✅ 正确入库方式:分块后批量嵌入
chunked_docs = [Document(page_content=chunk) for chunk in chunk_document(file_contents)]
vector_ids = qdrant_collection.add_documents(chunked_docs)  # 注意:非 add_texts()

⚠️ 关键提示:

可灵大模型
可灵大模型

可灵大模型(Kling)是由快手大模型团队自研打造的视频生成大模型

下载
  • chunk_size 建议设为 500–1000 字符(对应约 150–300 tokens),确保单个 chunk 在嵌入和检索时均轻量;
  • chunk_overlap(如 50–150)可缓解语义断裂,提升检索召回质量;
  • 使用 add_documents()(传入 Document 对象列表)而非 add_texts(),便于后续保留元数据(如 source、page)。

? 进阶控制:检索后动态 Token 裁剪(可选补充)

若业务场景要求更高灵活性(如允许部分长文档存在、需按需压缩 context),可在 retriever 后添加轻量级 token 截断层。以下是一个兼容 0.1.9 的 Runnable 封装示例(基于 tiktoken):

import tiktoken

def truncate_context_by_tokens(docs, max_tokens: int = 2000, model_name: str = "gpt-3.5-turbo"):
    encoder = tiktoken.encoding_for_model(model_name)
    truncated_docs = []
    total_tokens = 0

    for doc in docs:
        content = doc.page_content
        tokens = len(encoder.encode(content))
        if total_tokens + tokens  0:
                truncated_text = encoder.decode(encoder.encode(content)[:remaining])
                truncated_docs.append(Document(page_content=truncated_text, metadata=doc.metadata))
            break
    return truncated_docs

# 在 retrieval_chain 中集成
retriever = existing_vector_store.as_retriever(search_kwargs={"k": 5})
# 替换原 retriever:先检索,再按 token 截断
safe_retriever = lambda query: truncate_context_by_tokens(retriever.invoke(query), max_tokens=1800)

retrieval_chain = RunnablePassthrough.assign(
    context=lambda x: safe_retriever(x["messages"][-1].content),
).assign(
    answer=document_chain,
)

? 总结与最佳实践

措施 作用 推荐程度
入库前分块(必做) 从源头控制单个向量单元大小,提升检索精度与效率 ⭐⭐⭐⭐⭐
设置 search_kwargs={"k": N} 限制检索返回文档数量(如 k=3),避免冗余 ⭐⭐⭐⭐
Prompt 中明确指令 在 system prompt 加入 "请严格基于以下上下文回答,总输出不超过 500 字" 等约束 ⭐⭐⭐
链内 token 截断(可选) 应对不可控长文档或动态预算场景,增加复杂度 ⭐⭐

? 最终建议:不要试图在 create_retrieval_chain 中“打补丁式”限长,而应将分块作为数据治理标准流程。这不仅解决 token 超限,更能显著提升检索相关性与响应速度——因为小而精的 chunk 比大而泛的全文更易匹配用户 query。

通过以上方法,你无需升级 LangChain 版本,即可在现有技术栈上构建鲁棒、可扩展的 RAG 对话系统。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1104

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

2070

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1185

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

8776

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

1478

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

1550

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

881

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

530

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1111

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.4万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 131.8万人学习