sharegpt数据集可作为教师模型生成软标签与响应序列的关键输入源,用于模型蒸馏:一、基于对话样本进行教师推理生成prompt-logits-soft_target三元组;二、通过温度缩放与混合编码实现软目标对齐;三、提取中间层特征并归一化以协同构造结构监督信号;四、利用语义相似prompt对构建kl关系约束;五、依困惑度与熵值动态划分难度等级实施课程学习。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在开展模型蒸馏实验时需构建高质量的训练数据,但缺乏足够规模且语义丰富的指令微调样本,则ShareGPT数据集可作为教师模型生成软标签与响应序列的关键输入源。以下是利用该数据集实现教师模型到学生模型知识传递的具体方法:
一、基于ShareGPT对话样本的教师推理生成
ShareGPT数据集由真实用户与ChatGPT等大模型交互产生的多轮对话构成,包含丰富的指令-响应对、上下文依赖及隐含意图表达,适合作为教师模型的提示输入(prompt),以激发其输出高置信度、结构化、带概率分布的响应。该步骤旨在将原始文本对转化为含“暗知识”的蒸馏训练信号。
1、从ShareGPT数据集中随机采样10万条高质量多轮对话,过滤掉含敏感词、低信息量或截断不全的样本。
2、将每条对话的历史轮次拼接为完整prompt,格式为“[INST] 用户提问 [/INST] 模型回答”,确保与教师模型的推理范式一致。
3、使用温度参数T=1.0调用教师模型(如Llama-3-70B或Qwen2-72B)进行批量推理,获取每个prompt对应的logits输出及softmax概率分布。
4、保存原始prompt、教师模型输出文本、对应token级logits张量以及soft target概率矩阵,形成prompt-logits-soft_target三元组数据项。
二、软目标对齐与标签增强策略
原始ShareGPT响应为硬文本,直接监督学生模型易导致知识失真;引入教师模型生成的软目标可保留类别间相对置信度、token生成不确定性等隐含信息,提升学生模型对语义边界的建模能力。
1、对每条ShareGPT样本的教师logits,应用温度缩放T=5.0重新计算soft target,使概率分布更平滑,强化低概率token间的区分性。
2、将教师soft target与真实token标签联合编码:对每个目标token位置i,构造混合监督信号y_i = α × soft_target_i + (1−α) × one_hot(label_i),其中α设为0.65。
3、剔除soft target中最大概率低于0.001的token位置,防止噪声标签干扰学生模型收敛。
三、中间层特征蒸馏的数据协同构造
仅依赖输出层软目标无法传递教师模型内部表征结构;需借助ShareGPT prompt触发教师模型各层激活,并同步提取关键中间层特征,构建特征匹配监督信号。
1、在教师模型前向传播过程中,记录第12、24、32层Transformer块的输出特征图(shape: [seq_len, hidden_dim])。
2、对每层特征应用全局平均池化与L2归一化,生成固定维度的句向量表示,用于后续与学生模型对应层输出比对。
3、将ShareGPT prompt、教师各层归一化特征向量、soft target三者绑定为一条蒸馏样本,确保学生模型在响应生成过程中同步对齐语义与结构信息。
四、关系型知识抽取与样本重加权
ShareGPT中存在大量相似语义但表述差异显著的prompt变体(如“请总结” vs “用一句话概括”),教师模型对这些变体的响应相似度可构建样本间关系图,用于关系蒸馏。
1、对ShareGPT中所有prompt进行嵌入编码(使用Sentence-BERT),计算余弦相似度矩阵S∈ℝ^(N×N)。
2、选取相似度S_ij > 0.82的prompt对(i,j),提取其教师模型响应的KL散度D_KL(y_i∥y_j),作为关系约束损失项。
3、按D_KL值对样本对进行逆序加权,在学生模型训练中提升高一致性样本对的梯度贡献比例。
五、动态难度采样与课程学习调度
ShareGPT数据质量呈长尾分布,部分样本存在逻辑断裂、事实错误或响应冗余;需依据教师模型自身反馈动态筛选难易样本,实施课程学习策略。
1、对每条ShareGPT样本,计算教师模型输出的困惑度(PPL)与token级熵值均值H,定义难度分d = 0.4×PPL + 0.6×H。
2、将全部样本按d值升序排列,划分为5个难度等级,每级覆盖20%数据量。
3、在学生模型训练初期仅使用d值最低的20%样本(d ),每5个epoch逐步引入更高难度样本,直至全量参与。











