可通过四种方式下载sharegpt数据集:一、git clone官方github仓库;二、用curl/wget直接下载json文件;三、通过hugging face datasets库加载导出;四、用aria2c多线程加速下载。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望获取ShareGPT数据集用于学术研究或模型训练,需通过其官方GitHub仓库及社区镜像源下载原始JSON格式的公开对话数据。以下是完成下载的完整操作步骤:
一、从官方GitHub仓库克隆数据集
ShareGPT数据集由社区维护,主仓库托管在GitHub上,包含结构化JSONL文件与元信息说明。直接克隆可确保获取最新提交版本,并保留完整的提交历史与数据变更记录。
1、打开终端(macOS/Linux)或Git Bash(Windows),执行命令:git clone https://github.com/domeccleston/sharegpt.git
2、进入项目目录:cd sharegpt
3、查看可用数据文件列表:ls -l data/(常见文件如sharegpt_english.json、sharegpt_zh.json)
二、使用curl或wget下载单个JSON文件
若仅需特定语言子集或受限于网络环境无法使用Git,可跳过克隆,直接通过HTTP请求下载已发布的压缩包或原始JSON文件。该方式适合低带宽或防火墙严格环境。
1、访问ShareGPT发布页获取最新文件URL,例如:https://huggingface.co/datasets/anon8231489123/ShareGPT_Vicuna_unfiltered/resolve/main/sharegpt_html_clean.json
2、在终端中运行下载命令:curl -L -o sharegpt_html_clean.json "https://huggingface.co/datasets/anon8231489123/ShareGPT_Vicuna_unfiltered/resolve/main/sharegpt_html_clean.json"
3、验证文件完整性:sha256sum sharegpt_html_clean.json(比对README中提供的校验值)
三、通过Hugging Face Datasets库加载并导出
Hugging Face平台托管了多个经清洗与标准化的ShareGPT衍生数据集,支持Python接口直接加载、采样与本地保存,适用于需要动态过滤或分批处理的研究场景。
1、安装依赖:pip install datasets
2、运行Python脚本加载数据:from datasets import load_dataset; ds = load_dataset("anon8231489123/ShareGPT_Vicuna_unfiltered", split="train")
3、导出为本地JSONL文件:ds.to_json("sharegpt_local.jsonl", orient="records")
四、使用aria2c加速多线程下载大文件
当目标文件体积超过1GB且网络延迟较高时,aria2c可启用并发连接与断点续传,显著提升下载稳定性与速度,尤其适用于中国大陆用户访问境外托管资源。
1、安装aria2c:brew install aria2(macOS)或sudo apt install aria2(Ubuntu)
2、构造下载命令,启用5线程:aria2c -x 5 -s 5 -k 1M "https://huggingface.co/datasets/anon8231489123/ShareGPT_Vicuna_unfiltered/resolve/main/sharegpt_html_clean.json"
3、检查下载完成状态:ls -lh sharegpt_html_clean.json











