macos上搭建nlp开发环境需依次安装xcode命令行工具、homebrew和homebrew版python,创建虚拟环境并安装pytorch(mps/intel适配)、transformers等核心库,预缓存中文模型、配置nltk数据路径,并可选集成llama-cpp-python与hugging face缓存路径优化。
在 macos 上搭建适合自然语言处理(nlp)开发的环境,核心是稳定、可复现、兼顾本地推理与中文支持。不需要从零造轮子,重点在于选对工具链、避开常见依赖冲突,并为后续模型(如 chinese-llama-alpaca、rexuninlu 或 open-autoglm)留出兼容空间。
安装基础工具链:Xcode + Homebrew + Python
这是所有 NLP 开发的前提,尤其影响后续编译加速库(如 tokenizers、flash-attn)是否能顺利安装。
- 先装 Xcode 命令行工具:终端运行
xcode-select --install,弹窗点安装即可;验证用clang --version - 再装 Homebrew:粘贴官方命令
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)",完成后执行brew doctor确认无报错 - Python 推荐用 Homebrew 安装(而非系统自带或官网下载):
brew install python,它会自动设好路径,且 pip 与 setuptools 都已就绪;验证用python3 --version和pip3 --version
配置 Python 环境:虚拟环境 + 必备科学计算库
避免全局污染,也方便不同项目(比如一个跑 LLaMA,一个跑 NLTK)隔离依赖。
- 创建独立环境:
python3 -m venv nlp-env;激活:source nlp-env/bin/activate - 升级 pip 并装基础三件套:
pip install --upgrade pip && pip install numpy pandas matplotlib - 装 PyTorch(Apple Silicon 用户优先选 MPS 版本):
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu(Intel)或--index-url https://download.pytorch.org/whl/macosx/arm64(M1/M2/M3) - 装 Hugging Face 生态核心:
pip install transformers datasets accelerate scikit-learn
集成中文 NLP 支持:模型 + 工具 + 数据包
很多中文任务卡在预处理或模型加载上,提前配好能省大量调试时间。
- 下载并缓存常用中文模型:运行
from transformers import AutoTokenizer; tokenizer = AutoTokenizer.from_pretrained("hfl/chinese-roberta-wwm-ext"),首次会自动拉取到~/.cache/huggingface/transformers - NLTK 离线数据包:先
python -c "import nltk; nltk.download('punkt', download_dir='~/nltk_data')",再设置环境变量export NLTK_DATA=~/nltk_data(加到~/.zshrc中永久生效) - 如需中文分词增强,可选装
pip install jieba或pkuseg;若用 RexUniNLU 或 Chinese-LLaMA-Alpaca,它们自带 tokenizer,无需额外配置
可选但强烈建议:本地大模型支持准备
如果你计划跑 LLaMA 类模型(如 Chinese-LLaMA-Alpaca)、多模态(LLaVA)或自动化框架(Open-AutoGLM),这几步能显著减少后续报错。
- 确保
git可用(Homebrew 已含);克隆项目前,推荐用git config --global core.autocrlf input避免换行符问题 - 安装
llama-cpp-python(轻量本地推理):pip install llama-cpp-python --no-deps,再按文档编译支持 Metal 的版本(M系列芯片) - 预留模型存储空间:把
HUGGINGFACE_HUB_CACHE设为大容量磁盘路径,例如export HUGGINGFACE_HUB_CACHE="/Volumes/Data/hf-cache" - 如部署 Open-AutoGLM,需额外启用 Apple Neural Engine 支持,确认 macOS 版本 ≥ 13.5,并在项目中启用
use_mps=True或对应 backend 参数











