必须执行权重合并操作才能将deepseek v4分片权重整合为单个完整模型文件。方法包括:一、用transformers的convert_checkpoint.py工具;二、用safetensors官方工具直接合并;三、用huggingface_hub下载后加载导出;四、用openmind库进行npu适配合并。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已下载 DeepSeek V4 的分片权重(如 model-00001-of-00008.safetensors 等),但需将其整合为单个完整模型文件以用于本地推理或部署,则必须执行权重合并操作。以下是多种可行的合并方法:
一、使用 transformers 库的 convert_checkpoint.py 工具
该方法适用于标准 Hugging Face 格式分片模型,依赖 transformers 内置转换逻辑,兼容 safetensors 与 bin 格式。
1、确保已安装最新版 transformers:pip install --upgrade transformers
2、确认模型目录结构包含 config.json、pytorch_model.bin.index.json 或 model.safetensors.index.json 文件
3、在终端中执行命令:python -m transformers.models.auto.convert_checkpoint --model_name_or_path ./deepseek-v4-sharded --output_dir ./deepseek-v4-merged --dtype bfloat16
4、等待完成,输出目录中将生成完整的 model.safetensors 或 pytorch_model.bin 单文件
二、通过 safetensors 官方工具合并分片
该方法直接操作 safetensors 文件,不依赖模型架构定义,适用于仅需物理合并而无需验证结构的场景。
1、安装 safetensors 工具包:pip install safetensors
2、编写 Python 脚本 merge_safetensors.py,调用 safetensors.torch.combine_sharded 函数
3、脚本中指定分片路径列表,例如:["./model-00001-of-00008.safetensors", ..., "./model-00008-of-00008.safetensors"]
4、运行脚本:python merge_safetensors.py --output ./deepseek-v4-full.safetensors
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
三、使用 huggingface_hub 的 snapshot_download + 权重加载导出
该方法适合从 Hugging Face Hub 下载后立即合并,避免手动处理索引文件,自动识别并聚合所有分片。
1、安装依赖:pip install huggingface_hub torch
2、运行 Python 脚本,调用 snapshot_download(repo_id="deepseek-ai/DeepSeek-V4", local_dir="./v4-dl")
3、使用 AutoModelForCausalLM 加载分片模型:model = AutoModelForCausalLM.from_pretrained("./v4-dl", device_map="cpu", torch_dtype=torch.bfloat16)
4、执行保存:model.save_pretrained("./deepseek-v4-merged-standalone", safe_serialization=True)
四、基于 openMind Library 的 NPU 适配合并流程
该方法专为昇腾 NPU 部署设计,支持在合并过程中插入算子融合与张量格式转换,确保导出文件可直接被 CANN 工具链识别。
1、安装 openMind:pip install openmind
2、导入 OMModelForCausalLM 并指定 device="ascend"
3、加载分片模型时启用 merge_before_load=True 参数
4、调用 model.export_to_om("./deepseek-v4-npu.om", input_shapes={"input_ids": [1, 2048]})









