ShareGPT数据集在SFT监督微调中的标准用法:有监督微调的数据加载和训练设置

轻伟大大_5983

轻伟大大_5983

2026-05-29

807人浏览

原创

sharegpt数据集需满足conversations中human/gpt交替且至少两轮,首为human、末为gpt;system字段须为非空字符串;加载时须匹配对应模板(如--template sharegpt)或转为instruction-output格式,否则因解析错误导致keyerror或loss不降。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

sharegpt数据集在sft监督微调中的标准用法:有监督微调的数据加载和训练设置

你需要把ShareGPT数据集直接用于SFT监督微调,但训练脚本报错“KeyError: 'instruction'”或loss不下降,说明原始conversations结构未被正确解析——这不是数据质量问题,而是加载路径与模型期望格式不匹配导致的解析中断。

确认ShareGPT原始结构是否满足SFT基本要求

打开你的sharegpt_zh.json文件,用文本编辑器搜索任意一条样本的"conversations"字段。该数组必须至少包含两个对象,且from值严格交替为"human"→"gpt"→"human"→"gpt"……首项必须是"human",末项推荐为"gpt"。若出现连续两个"human"或某条缺失from键,该样本将被主流框架静默丢弃。

执行命令jq '.[0].conversations | length'检查首条样本轮次长度。结果小于2的样本必须过滤——【SFT阶段严禁使用单轮human无响应的数据】,否则训练时会因output为空导致loss爆梯度。

检查是否存在system字段。若有,需确认其value是否为字符串类型而非null或空对象;非字符串system内容会导致LLaMA-Factory tokenizer在拼接时抛出TypeError。

方法一:用LLaMA-Factory零代码加载(推荐新手)

这一步操作起来很简单,直接把原始ShareGPT JSON文件扔进data目录就行。

在LLaMA-Factory项目根目录下执行:cp sharegpt_zh.json data/,重命名为sharegpt_zh_custom.json。

运行训练命令时必须显式指定--template sharegpt参数,否则框架默认按alpaca模板解析,会把conversations整个数组当instruction字符串切分,造成语义断裂。

AI Prompt Generator
AI Prompt Generator

AI Prompt Generator是一款AI提示词工具,什么 A...。

下载

确保dataset_info.json中已注册该数据集:添加条目{"sharegpt_zh_custom": {"file_name": "sharegpt_zh_custom.json", "formatting": "sharegpt"}},否则--dataset参数无法命中配置。

方法二:手动转换为ChatGLM兼容的instruction-output三元组

ChatGLM官方train_bash.py不识别conversations字段,必须重构为{"instruction": "...", "input": "", "output": "..."}结构。

  1. 提取每条conversations中第一个from: "human"的对象,其value作为instruction字段值;
  2. 跳过中间所有轮次,定位最后一个from: "gpt"的对象,其value作为output字段值;
  3. 若该gpt对象value为空字符串或仅含换行符,整条样本丢弃——【空回复会导致ChatGLM tokenizer生成全-100 labels,loss恒为nan】;
  4. 用json.dumps()逐行写入新文件,保存为UTF-8无BOM编码,扩展名必须为.jsonl。

注意:input字段强制设为空字符串"",不可省略或填null,否则ChatGLM-Efficient-Tuning会因字段缺失触发default_factory异常。

方法三:适配Hugging Face Transformers原生Trainer

如果你用Trainer + SFTTrainer类训练,需自定义Dataset类来处理嵌套结构。

继承torch.utils.data.Dataset,__getitem__中对conversations做如下处理:取前N-1轮拼成prompt(human+gpt交替),最后一轮gpt作为response,再用tokenizer.encode(prompt+response, truncation=True, max_length=2048)。

关键点在于labels构造:对prompt部分token全部赋值-100,仅response对应token保留真实id。若用AutoTokenizer.from_pretrained("xxx")加载,必须确认其add_eos_token=True,否则response末尾缺少eos token会导致loss计算漏掉最后一个词。

这一步不能跳过——没有正确mask的labels会让模型学习预测用户提问,而非生成回答。

相关专题

更多
数据分析的方法
数据分析的方法

数据分析的方法有:对比分析法,分组分析法,预测分析法,漏斗分析法,AB测试分析法,象限分析法,公式拆解法,可行域分析法,二八分析法,假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

2023.07.04

1682

6

数据分析方法有哪几种
数据分析方法有哪几种

数据分析方法有:1、描述性统计分析;2、探索性数据分析;3、假设检验;4、回归分析;5、聚类分析。本专题为大家提供数据分析方法的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.07

2270

5

网站建设功能有哪些
网站建设功能有哪些

网站建设功能包括信息发布、内容管理、用户管理、搜索引擎优化、网站安全、数据分析、网站推广、响应式设计、社交媒体整合和电子商务等功能。这些功能可以帮助网站管理员创建一个具有吸引力、可用性和商业价值的网站,实现网站的目标。

2023.10.16

6330

14

数据分析网站推荐
数据分析网站推荐

数据分析网站推荐:1、商业数据分析论坛;2、人大经济论坛-计量经济学与统计区;3、中国统计论坛;4、数据挖掘学习交流论坛;5、数据分析论坛;6、网站数据分析;7、数据分析;8、数据挖掘研究院;9、S-PLUS、R统计论坛。想了解更多数据分析的相关内容,可以阅读本专题下面的文章。

2024.03.13

2904

8

Python 数据分析处理
Python 数据分析处理

本专题聚焦 Python 在数据分析领域的应用,系统讲解 Pandas、NumPy 的数据清洗、处理、分析与统计方法,并结合数据可视化、销售分析、科研数据处理等实战案例,帮助学员掌握使用 Python 高效进行数据分析与决策支持的核心技能。

2025.09.08

4085

12

Python 数据分析与可视化
Python 数据分析与可视化

本专题聚焦 Python 在数据分析与可视化领域的核心应用,系统讲解数据清洗、数据统计、Pandas 数据操作、NumPy 数组处理、Matplotlib 与 Seaborn 可视化技巧等内容。通过实战案例(如销售数据分析、用户行为可视化、趋势图与热力图绘制),帮助学习者掌握 从原始数据到可视化报告的完整分析能力。

2025.10.14

6092

24

Python 数据分析与可视化合集
Python 数据分析与可视化合集

聚焦 Python 在数据分析领域的核心应用,讲解 NumPy 数组运算、Pandas 数据清洗与聚合统计、缺失值与异常值处理、数据透视表生成,以及使用 Matplotlib、Seaborn、Pyecharts 制作折线图、柱状图、热力图、地图等多种可视化图表,适合数据分析师和运营人员快速掌握用 Python 从原始数据中挖掘洞察的能力。

2026.04.08

276

25

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

431

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习