高质量sharegpt类对话数据筛选需五步:一评复杂性(≥4.2分且含多层语义),二验连贯性(强依赖轮次语义一致率≥65%),三查真实性(保留有分享理由或收藏/浏览比≥0.18样本),四核格式(from字段仅限human/gpt,conversations长3–21轮),五扫隐私(pii组合出现或被强化者剔除)。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您正在为大语言模型微调准备对话数据,但发现训练效果不稳定或泛化能力差,则可能是由于所用对话样本在信息密度、上下文连贯性或真实性方面存在缺陷。以下是筛选高质量ShareGPT类对话数据的具体评估方法:
一、评估对话复杂性:衡量信息密度与推理深度
复杂性反映单轮对话中是否包含多层语义、约束条件、领域术语或逻辑推演,是区分“表面问答”与“深度交互”的核心指标。高复杂性对话能有效提升模型的推理与表达能力。
1、提取每条human-gpt交替对中的gpt回复文本,输入预训练的7B复杂度评分模型进行打分,阈值设为≥4.2(满分5.0);
2、人工抽检高分样本,验证是否包含至少两个以下要素:具体数值、对比关系、因果解释、步骤分解或专业术语嵌套;
3、剔除仅含定义性陈述(如“区块链是一种分布式账本技术”)或单一事实复述的低信息量回复。
二、检验上下文连贯性:识别多轮依赖强度
上下文连贯性指模型能否基于前序多轮对话准确理解当前指令意图,其强弱直接决定SFT后模型在真实场景中的持续对话能力。需通过结构化标记与回溯验证双重判断。
1、解析conversations数组,对每轮human消息标注其是否显式引用前序gpt回复中的实体、结论或未尽事项;
2、对标注为“强依赖”的human消息,强制截断其前序所有轮次,单独输入模型生成回复,比对原始gpt回复的语义一致性,差异率超过35%则判定该轮连贯性不合格;
3、剔除连续三轮内无任何代词指代、无话题延续、无需求修正的“伪多轮”对话片段。
三、验证真实性与质量筛选机制:利用用户分享行为反推数据可信度
ShareGPT数据天然具备行为级质量信号——用户主动分享意愿本身即是对交互体验的隐式投票。应将分享动机作为过滤杠杆,而非仅依赖文本表层特征。
1、保留包含明确分享理由字段(如"share_reason":"这个回答帮我解决了生产环境bug")的对话样本;
2、过滤掉metadata中缺失user_device、session_duration或interaction_rating字段的记录;
3、对无结构化元数据的原始JSON,统计该对话在ShareGPT社区页面的收藏数/浏览数比值 ≥ 0.18作为替代质量代理指标。
四、检查角色与格式标准化程度:确保可直接注入训练流程
格式标准化程度决定了数据清洗成本。ShareGPT原始数据虽以human/gpt为主流,但存在大量role字段混用(如user/assistant)、system字段缺失或tools字段污染等情况,必须统一校验。
1、遍历每条记录的conversations列表,强制要求所有from字段严格等于"human"或"gpt",其余值视为格式错误并隔离;
2、对含system字段的样本,验证其长度是否在12–280字符区间内,超出则提示可能为冗余提示词或越界注入内容;
3、剔除conversations数组长度小于3或大于21的对话,前者缺乏多轮基础,后者易引入记忆衰减噪声。
五、检测敏感信息残留与隐私风险等级
未经脱敏的真实对话常含邮箱、手机号、地址、健康数据等PII,若直接用于训练,将导致模型记忆并泄露用户隐私。必须实施结构化隐私扫描而非简单关键词屏蔽。
1、使用命名实体识别模型(如spaCy en_core_web_lg)对human消息逐句标注PERSON、EMAIL、PHONE、ORG、DATE等类型;
2、对标注出的PII实体,检查其在后续gpt回复中是否被重复提及或推导强化,若存在则整条对话标记为高风险(Risk Level 3)并排除;
3、对含medical_condition、financial_amount、location_detail三类实体组合出现的对话,无论是否被回复引用,一律剔除。










