需完成模型下载、环境配置及本地部署:一、克隆github源码并检出main分支;二、从hugging face下载model.safetensors权重;三、配置python虚拟环境并安装pytorch等依赖;四、用transformers加载模型运行推理;五、通过ollama构建并运行本地api服务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望获取并运行Capybara开源模型,需要完成模型文件的下载、环境配置及本地部署等步骤。以下是具体操作流程:
一、从GitHub仓库克隆Capybara源码
该方法适用于具备Git基础且需获取最新开发版本的用户。源码包含训练脚本、推理接口及配置文件,是后续安装与运行的基础。
1、打开终端或命令提示符,执行以下命令克隆官方仓库:
git clone https://github.com/llm-wg/capybara.git
2、进入项目根目录:
cd capybara
3、检出稳定分支(如存在)以避免兼容性问题:
git checkout main
二、使用Hugging Face Hub直接下载模型权重
该方式跳过源码编译,适用于仅需运行推理的用户。模型权重以SafeTensors格式提供,安全性高且加载速度快。
1、访问Hugging Face模型页面:https://huggingface.co/llm-wg/capybara-7b
2、点击“Files and versions”标签页,找到以model.safetensors结尾的文件
3、点击右侧下载图标,将文件保存至本地指定路径(例如:./models/capybara-7b/)
三、配置Python运行环境
确保系统中安装了兼容版本的PyTorch与Transformers库,避免CUDA驱动不匹配导致推理失败。
1、创建独立虚拟环境:
python -m venv capybara-env
2、激活环境:
source capybara-env/bin/activate(Linux/macOS)或 capybara-env\Scripts\activate.bat(Windows)
3、安装依赖项:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers accelerate bitsandbytes
四、加载模型并运行本地推理
使用Transformers库原生API加载模型,支持CPU与GPU自动识别,无需手动指定设备。
1、新建Python脚本(如run_inference.py),写入以下内容:
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("./models/capybara-7b")
model = AutoModelForCausalLM.from_pretrained("./models/capybara-7b")
2、添加推理逻辑:
input_text = "Explain quantum computing in simple terms."
inputs = tokenizer(input_text, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
3、在终端中执行:
python run_inference.py
五、通过Ollama快速部署Capybara模型
该方式面向轻量级本地服务需求,一键启动HTTP API,便于集成至前端或自动化工具链。
1、确保已安装Ollama(v0.1.35或更高版本):
ollama --version
2、将Hugging Face模型转换为Ollama可识别格式,创建Modelfile:
FROM ./models/capybara-7b/model.safetensors
PARAMETER num_ctx 4096
3、构建并运行模型:
ollama create capybara-7b -f Modelfile
ollama run capybara-7b











