需通过rag架构将企业文档注入千问模型问答流程:一、文档结构化预处理;二、构建向量索引存入数据库;三、配置千问模型与rag推理链;四、部署内网webui并设访问限制;五、验证准确率与响应延迟。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望让千问模型基于企业内部文档精准回答问题,但模型本身不具备私有知识,则需要通过检索增强生成(RAG)架构将文档内容注入问答流程。以下是搭建该系统的具体步骤:
一、准备知识文档并完成结构化预处理
该步骤的目标是将原始文档转化为模型可检索的语义单元。需去除页眉页脚、扫描件OCR噪声、表格格式干扰,并按语义完整性进行分块,确保每块文本能独立表达一个知识点。
1、收集企业可用文档类型,包括TXT、MD、PDF、Word及内部HTML页面。
2、对PDF文档使用PyMuPDF或pdfplumber提取纯文本,跳过图像与加密内容。
3、按段落切分文本,若段落过短(少于80字符),则合并至前一段;若过长(超600字符),则按句号或分号二次切分。
4、为每一块文本添加唯一ID与来源元数据(如文件名、页码、更新时间)。
二、构建向量索引并存入向量数据库
该步骤将文本块转换为高维向量,使系统可通过语义相似度而非关键词匹配实现精准召回,是RAG中“检索”环节的核心支撑。
1、选用text2vec-large-chinese或bge-m3作为嵌入模型,加载后批量生成文本块向量。
2、初始化Milvus或Chroma数据库,创建collection,字段包含id、vector、source、content。
3、将向量与对应元数据批量写入数据库,执行create_index操作,索引类型设为IVF_FLAT,nlist=1024。
4、插入完成后调用flush()确保数据持久化,并用search接口验证单条向量召回效果。
三、配置千问模型服务并启用RAG推理链
该步骤将千问模型接入检索结果,使其在生成答案时严格依据召回的文档片段,避免幻觉输出,保障答案的准确性与可追溯性。
1、部署Qwen1.5-1.8B-Chat-GPTQ-Int4模型,使用vllm框架启动,监听端口8000。
PHP中文网提供Qwen-1.0.2.6 MacOS官方客户端下载,专为苹果电脑优化的阿里通义千问桌面应用。本版本深度适配Mac系统,支持本地高效运行与多模态交互,集成超长上下文处理、AI写作、代码生成及智能体构建等核心功能。通过官方渠道下载,确保安全稳定,助您实现智能办公与创作升级。
2、在LangChain中定义RetrievalQA链,设置retriever为MilvusVectorStoreRetriever,top_k=3。
3、编写prompt模板,强制要求模型仅依据context中提供的信息作答,并在末尾标注[来源: {source}]。
4、启动Chainlit前端服务,绑定LLM与retriever,验证输入“年假申请流程”是否返回带来源标注的结构化回答。
四、部署WebUI并限制内网访问范围
该步骤确保系统仅在企业可信网络内运行,防止知识外泄,同时提供直观交互界面,降低非技术人员使用门槛。
1、修改Chainlit配置文件,将host设为0.0.0.0,port设为8080,禁用public share功能。
2、在Nginx反向代理层添加IP白名单规则,仅允许可信子网(如192.168.10.0/24)访问。
3、为登录入口启用HTTP Basic Auth,用户名与密码由运维团队统一分发。
4、在页面底部固定显示水印:“本系统知识内容仅限内部员工使用,严禁截图外传”。
五、验证问答准确率与响应延迟
该步骤通过真实业务问题抽检,确认系统在关键场景下的可用性,避免上线后出现高频率误答或超时失败。
1、从HR制度、IT SOP、产品手册中各抽取10个典型问题,构成30题测试集。
2、人工标注每个问题的标准答案及对应原文位置(文件+段落编号)。
3、批量提交测试集至系统,记录每题响应时间(要求≤3.5秒)与答案匹配度(要求≥92%)。
4、对未达标题目分析原因:若为召回失败,优化embedding模型或分块策略;若为生成失准,调整prompt约束强度。










