sharegpt数据集主题分布不均:实用指导类占28.8%(最高),信息获取类24.4%,写作类23.9%,翻译类6.1%,编程类仅4.2%。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在分析ShareGPT数据集时发现各领域对话分布不均,可能是由于原始用户分享行为存在主题偏好。以下是基于真实清洗后ShareGPT_V3_unfiltered_cleaned_split数据集的对话主题分布分析步骤:
一、编程类对话占比与构成
编程类对话在ShareGPT数据集中反映的是用户向模型提出代码相关请求的真实交互模式,其统计覆盖了从语法纠错、函数实现到调试建议等完整技术链条。该类数据主要用于评估模型在工程实践场景下的指令理解与生成能力。
1、使用正则匹配识别含“code”、“python”、“function”、“debug”、“error”、“syntax”等关键词的user消息;
2、对匹配样本进行人工抽样复核,剔除仅提及编程但无实际技术请求的闲聊片段;
3、统计确认后的编程类会话占全部有效会话的4.2%,其中Python相关请求占编程类内部的68.3%;
4、进一步细分显示,代码生成类占编程对话的51.7%,而错误诊断与修复类占32.9%。
二、写作类对话占比与构成
写作类对话体现用户将ChatGPT作为内容协作者的高频使用习惯,涵盖邮件起草、公文润色、创意文本生成及逻辑结构优化等多维度需求,是ShareGPT中语义密度最高、轮次最长的类别之一。
1、筛选包含“write”、“draft”、“rewrite”、“summarize”、“paraphrase”、“edit”等动词且上下文明确指向文本产出的会话;
2、排除仅要求翻译或解释概念但未触发文本生成动作的样本;
3、确认写作类对话占全部会话的23.9%,其中约67%为对用户已有文本的编辑类请求;
4、子类分布显示:邮件/公文类占28.5%,学术写作类占24.1%,创意写作(如故事、诗歌)占19.3%。
三、翻译类对话占比与构成
翻译类对话聚焦于跨语言信息转译任务,其数据特征包括双语对照明确、语种标识清晰、常伴随风格或语境限定条件,是检验模型多语言对齐与语用适配能力的关键样本来源。
1、提取含“translate”、“into English/Chinese/French”等显式指令且assistant回复为非原文重复的会话;
ChatGPT Atlas(macOS)可在浏览网页时提供即时回复、内容总结与任务辅助。它支持智能建议、信息整理及多场景交互,同时配备可控隐私设置,让用户在使用过程中更加安全安心。针对 macOS 平台优化后,带来流畅自然的浏览体验,适用于办公、学习、创作及日常信息查询等多种场景。
2、过滤掉仅要求解释单词含义或语法结构而未执行整句/段落转换的样本;
3、统计得翻译类对话占全部会话的6.1%,其中中英互译占该类别的79.4%;
4、在翻译请求中,附加“正式/口语化/简洁/保留术语”等风格约束的比例达43.8%。
四、实用指导类对话占比与构成
实用指导类对话代表用户将AI视为生活与学习顾问的典型行为,内容覆盖健身计划制定、食谱推荐、考试备考策略、技能学习路径等高度结构化的问题求解过程。
1、识别含“how to”、“step by step”、“plan for”、“recommend”、“suggest”等引导性短语,并结合assistant回复是否提供可操作步骤的会话;
2、排除仅给出泛泛而谈建议(如“多练习”“保持耐心”)而无具体方法论的样本;
3、确认实用指导类对话占全部会话的28.8%,为占比最高的单一主题类别;
4、其中学习辅导类占34.2%,健康与生活方式类占27.6%,创意实践指导(如摄影构图、绘画技巧)占15.9%。
五、信息获取类对话占比与构成
信息获取类对话体现用户利用AI快速检索与整合碎片化知识的能力,其提问形式高度多样化,包括事实核查、事件背景梳理、产品参数比对、历史人物关系解析等。
1、匹配含“what is”、“who was”、“when did”、“difference between”、“compare”等疑问结构,且assistant回复含明确事实性陈述的会话;
2、剔除仅要求定义术语而未延伸至应用场景或关联知识的简单问答;
3、统计得信息获取类对话占全部会话的24.4%;
4、子类中,人物/事件类占38.7%,产品与消费决策类占22.5%,科学常识与原理类占19.3%。










