☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
如果您需要在无网络或受限网络环境中运行trae agent,但又无法依赖云端模型服务,则必须通过本地模型加载与离线工具链配置实现完全自主的ai能力。以下是实现trae本地模型部署与离线开发的多种可行方案:
一、基于Ollama的本地模型服务部署
该方法通过在目标机器上独立运行Ollama服务,加载已预置的GGUF格式模型,使Trae Agent无需任何外部网络请求即可完成推理任务。所有模型文件、运行时依赖及服务配置均需提前导入内网环境,适用于具备中等算力(如RTX 3060及以上)的服务器或工作站。
1、在内网机器上执行Ollama安装脚本(需提前将install.sh复制至内网):
curl -fsSL ./install.sh | sh
2、将已下载的模型文件(如deepseek-r1-7b.Q4_K_M.gguf)通过U盘或内网传输工具复制到目标机器指定目录:
/opt/ollama/models/
3、使用ollama load命令加载模型包:
ollama load ./deepseek-r1-7b.Q4_K_M.gguf
4、启动Ollama服务并绑定本地回环地址与端口:
OLLAMA_HOST=127.0.0.1:11434 ollama serve &
5、验证服务状态:
curl http://127.0.0.1:11434/api/tags
二、trae-core直连GGUF模型部署
该方式绕过Ollama中间服务层,由trae-core内置llama.cpp后端直接加载单文件GGUF模型,适用于资源高度受限、禁止运行额外守护进程的封闭内网场景。模型以静态文件形式存在,启动即用,无后台服务依赖,内存占用更低且启动延迟更短。
1、从可信来源获取适配trae-core的GGUF模型(如deepseek-r1-7b.Q4_K_M.gguf),存入内网机器指定路径:
/opt/trae/models/deepseek-r1-7b.Q4_K_M.gguf
2、创建离线配置文件trae_config_local.yaml,明确指定模型路径、推理后端及上下文参数:
model:
provider: "llama_cpp"
name: "deepseek-r1-7b"
path: "/opt/trae/models/deepseek-r1-7b.Q4_K_M.gguf"
n_ctx: 4096
n_threads: 8
3、启动Trae时强制指定该配置文件:
trae --config trae_config_local.yaml
4、确认模型加载日志中出现"llama_model_load_internal: loaded meta data"字样,表示GGUF模型成功载入。
三、离线工具链全量预置与联网校验禁用
默认情况下,Trae会在首次运行时尝试连接GitHub或PyPI校验工具版本及插件签名,此行为在纯内网中必然失败并阻断初始化流程。本方案通过预置全部工具二进制文件、替换校验逻辑为本地哈希比对,彻底切断对外网络调用路径,确保零网络依赖下的首次启动成功率。
1、在可联网环境预先执行工具下载与缓存:
trae tools install bash_tool edit_tool json_edit_tool task_done_tool --offline-cache-dir ./tools_cache
2、将./tools_cache目录整体拷贝至内网机器,并在trae_config_local.yaml中声明:
tools:
cache_dir: "/opt/trae/tools_cache"
disable_network_check: true
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
3、修改trae-core源码中verify_tool_signature()函数,将其替换为本地SHA256校验逻辑,校验值从tools_cache/.signatures.json读取。
4、执行初始化命令跳过网络探测:
trae init --skip-network-check
四、模型+工具+配置镜像化封装部署
该方案面向企业级批量部署场景,将模型文件、工具二进制、配置模板、启动脚本及运行时依赖打包为标准Docker镜像,通过私有Registry分发至各内网节点。镜像内固化所有路径与权限策略,规避部署时的手动配置误差,支持一键拉取与运行。
1、构建基础镜像时集成CUDA 12.1驱动与llama.cpp v0.2.80编译产物:
FROM nvidia/cuda:12.1.1-devel-ubuntu22.04
2、将预验证的GGUF模型、tools_cache、trae_config_local.yaml统一复制进镜像内固定路径:
COPY models/ /opt/trae/models/
COPY tools_cache/ /opt/trae/tools_cache/
COPY config/trae_config_local.yaml /etc/trae/trae_config.yaml
3、设置容器启动入口为trae主进程,并绑定GPU设备与共享内存:
ENTRYPOINT ["trae", "--config", "/etc/trae/trae_config.yaml"]
docker run --gpus all --shm-size=2g -p 8080:8080 trae-offline:deepseek-r1-7b
4、验证容器内模型加载状态:
docker exec -it
五、CPU-only轻量级离线部署
该方案专为无GPU硬件环境设计,利用llama.cpp的纯CPU推理能力与量化模型(Q4_K_M或Q3_K_S),在Intel i5-1135G7或AMD Ryzen 5 5600U级别处理器上实现可用响应速度。适用于笔记本、边缘网关、信创终端等低功耗设备,不依赖NVIDIA驱动或CUDA环境。
1、下载适配CPU的trae-core发行版(含llama.cpp静态链接库):
trae-core-cpu-v0.9.3-linux-x86_64.tar.gz
2、解压后将Q3_K_S格式的deepseek-r1-7b模型放入models子目录:
tar -xzf trae-core-cpu-v0.9.3-linux-x86_64.tar.gz
mv deepseek-r1-7b.Q3_K_S.gguf models/
3、启用CPU专用配置项,在trae_config_local.yaml中设置:
model:
provider: "llama_cpp"
use_mmap: true
use_mlock: false
n_threads: 6
4、启动服务并限制最大内存占用:
trae --config trae_config_local.yaml --max-memory 4g
5、监控CPU推理吞吐量:
trae metrics --interval 5s | grep "tokens_per_second"










