deepseek v4尚未在ollama官方仓库发布,当前仅支持r1系列等已量化模型;需通过ollama list/search验证、选用替代模型(如deepseek-r1:8b-q4_k_m)、手动转换gguf或调参(--num-gpu、ollama_no_kv_cache)解决卡死问题。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您尝试在Ollama中运行DeepSeek V4模型但进程卡死、无响应或直接报错退出,则极可能因该模型尚未在Ollama官方镜像仓库中正式发布,且其原始权重未适配Ollama支持的GGUF量化谱系。当前Ollama v0.5.0+仅兼容经llama.cpp工具链转换并标注为q4_k_m、q5_k_m等白名单量化类型的GGUF文件,而DeepSeek V4的公开权重多为Hugging Face原生格式(如safetensors)或非标准GGUF变体,导致加载阶段即失败。以下是针对性排查与替代执行路径:
一、验证模型是否存在官方量化镜像
Ollama不支持直接加载任意DeepSeek V4权重,必须依赖社区或官方构建并推送至registry的合规镜像。若本地未拉取对应标签,ollama run命令将静默失败或返回“no such model”。
1、执行ollama list | grep -i deepseek,确认输出中是否包含含v4字样的条目,例如deepseek-v4:7b-q4_k_m或deepseek-v4:8b-q5_k_m。
2、若无匹配结果,运行ollama search deepseek-v4,检查Ollama Hub是否已收录该模型——截至2026年4月25日,Ollama官方Hub尚未上架任何DeepSeek V4版本的量化镜像。
3、访问Ollama Library网页端,手动搜索“deepseek v4”,确认状态为“Not found”或“Coming soon”。
二、使用替代模型实现近似能力
DeepSeek V4尚未发布,当前可稳定运行于Ollama的最高代际为DeepSeek-R1系列(如DeepSeek-R1-Distill-Llama-8B)及DeepSeek-Coder 33B-Q4_K_M。这些模型在数学推理、代码生成等核心能力上已覆盖V4预告的技术方向,且经过充分量化验证。
1、拉取并运行已验证的高兼容性替代模型:ollama pull deepseek-r1:8b-q4_k_m。
2、启动服务:ollama run deepseek-r1:8b-q4_k_m。
3、验证显存占用:nvidia-smi --query-gpu=memory.used,memory.total --format=csv,确认峰值显存稳定在≤7.2 GB(RTX 4060 Ti级别显卡可承载)。
三、手动构建兼容GGUF量化模型(高级)
若您已获取DeepSeek V4的Hugging Face原始权重(如deepseek-ai/deepseek-v4-8b),需通过llama.cpp工具链完成格式转换与量化,生成Ollama可识别的GGUF文件。此过程绕过Ollama Hub,但要求本地具备CUDA编译环境与足够磁盘空间。
1、克隆最新llama.cpp:git clone --recursive https://github.com/ggerganov/llama.cpp,并执行make clean && make -j编译CUDA后端。
2、进入llama.cpp目录,运行转换脚本:python convert-hf-to-gguf.py deepseek-ai/deepseek-v4-8b --outfile deepseek-v4-8b.Q4_K_M.gguf。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
3、执行量化:./quantize deepseek-v4-8b.Q4_K_M.gguf deepseek-v4-8b.Q4_K_M.gguf q4_k_m。
4、创建Ollama Modelfile:FROM ./deepseek-v4-8b.Q4_K_M.gguf,保存为Modelfile。
5、构建本地模型:ollama create deepseek-v4-local -f Modelfile。
四、强制启用CPU卸载规避显存瓶颈
当模型虽经量化但仍超出GPU显存容量时,Ollama支持将部分层保留在系统内存中,仅将计算密集层送入GPU。该机制依赖--num-gpu参数控制GPU参与层数,适用于所有GGUF模型,包括手动构建的V4变体。
1、确认当前GPU最大可承载层数:对8B模型,RTX 3090(24GB)建议上限为45层,RTX 4060 Ti(8GB)建议上限为22层。
2、运行带层数限制的模型:ollama run --num-gpu=22 deepseek-v4-local。
3、观察nvidia-smi输出,验证GPU显存占用是否回落至≤7.8 GB,同时htop显示RAM占用上升但未触发OOM Killer。
五、禁用KV缓存预分配释放瞬时显存压力
Ollama默认为最大上下文长度(4096)全额预分配KV缓存,造成显存虚高。对于DeepSeek类模型,实际推理常使用2048以内上下文,关闭预分配可立即释放1.2–1.8 GB显存。
1、设置环境变量禁用预分配:export OLLAMA_NO_KV_CACHE=1。
2、重启Ollama服务:systemctl --user restart ollama(Linux)或brew services restart ollama(macOS)。
3、重新运行模型,此时首次token生成延迟略有增加,但nvidia-smi中显存峰值下降≥1.5 GB,对低显存设备尤为关键。









