Apple Silicon AI — 在 Mac Studio、Mac Mini、MacBook Pro 和 Mac Pro 上运行大语言模型(LLM)、图像生成、语音转文字及嵌入(embeddings)。将您的 Apple Silicon 设备…
苹果硅AI — Your Macs Are the Cluster. 把你的Mac Studio, Mac Mini, MacBook Pro, 或 Mac P是一项面向实际任务的技能。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;
涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
将你的 Mac Studio、Mac Mini、MacBook Pro 或 Mac Pro 转变为本地 Apple Silicon AI 集群。一个统一接入点即可将大语言模型(LLM)推理、图像生成、语音转文字(speech-to-text)和嵌入(embeddings)任务,智能分发至你局域网内的每一台 Apple Silicon 设备。
无需云 API,无需租用 GPU,无需 Docker。你的 Apple Silicon M1/M2/M3/M4 芯片配备统一内存(unified memory),其推理性能已超越大多数云端实例——你只需一套能将其视为 Apple Silicon 集群来调度的软件。
Apple Silicon 的统一内存使整个模型驻留在单一地址空间中——无 PCIe 带宽瓶颈,无 CPU-GPU 数据搬运开销。一台搭载 M4 Ultra 芯片与 256GB 内存的 Mac Studio,可原生运行参数量达 120B 的模型,而同等能力在云端通常需多块 NVIDIA A100 才能实现。这正是 Apple Silicon 的核心优势。
| Apple Silicon 芯片 | 统一内存 | LLM 最佳适用规模 | Apple Silicon 图像生成能力 | 备注 |
|---|---|---|---|---|
| M1(8GB) | 8GB | 7B 模型 | 较慢 | 入门级 Apple Silicon |
| M1 Pro/Max(32–64GB) | 32–64GB | 14B–32B | 具备实用能力 | Apple Silicon MacBook Pro |
| M2 Ultra(192GB) | 192GB | 70B–120B | 快速 | Apple Silicon Mac Studio/Pro |
| M3 Max(128GB) | 128GB | 70B | 快速 | 最新款 Apple Silicon MacBook Pro |
| M4 Max(128GB) | 128GB | 70B | 快速 | Apple Silicon Mac Studio,最新一代 |
| M4 Ultra(256GB) | 256GB | 120B+ | 极快 | Apple Silicon Mac Studio/Pro,支持最大规模模型 |
pip install ollama-herd # 针对 Apple Silicon 优化的推理路由工具
herd # 在端口 11435 启动 Apple Silicon 路由器
herd-node # Apple Silicon 节点自动发现路由器
完成。Apple Silicon 节点会在本地网络中自动发现路由器,无需配置 IP 地址,也无需编辑配置文件。如需显式指定连接,可使用 herd-node --router-url http://。
MacBook Pro(M3 Max,64GB) ─┐ Mac Mini(M4,32GB) ├──→ Apple Silicon 路由器(:11435) ←── 你的应用 Mac Studio(M4 Ultra,256GB) ─┘
Apple Silicon 路由器基于 7 类信号对每台设备进行评分,并将每个请求动态路由至当前状态最优的 Mac——包括温度状态、内存适配度、队列深度等指标。
在你的 Apple Silicon 集群上运行 Llama、Qwen、DeepSeek、Phi、Mistral、Gemma 等任意 Ollama 兼容模型。
curl http://localhost:11435/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "llama3.3:70b",
"messages": [{"role": "user", "content": "解释 Apple Silicon 统一内存架构"}]
}'
curl http://localhost:11435/api/chat
-d '{"model": "qwen3:32b", "messages": [{"role": "user", "content": "对比 Apple Silicon M4 与 M3 在 AI 推理方面的差异"}]}'
from openai import OpenAI
# Apple Silicon 推理客户端
apple_silicon_client = OpenAI(base_url="http://localhost:11435/v1", api_key="unused")
apple_silicon_response = apple_silicon_client.chat.completions.create(
model="deepseek-r1:70b",
messages=[{"role": "user", "content": "为 Apple Silicon 优化该函数"}]
)
使用原生 MLX 实现的 Flux 模型生成图像。完全在 Apple Silicon 上本地运行——无需 CUDA,亦不依赖云端服务。
curl http://localhost:11435/api/generate-image
-d '{"prompt": "Apple Silicon Mac Studio 渲染 AI 艺术作品,照片级真实感", "model": "z-image-turbo", "width": 512, "height": 512}'
Apple Silicon 图像生成性能:
通过 MLX 运行 Qwen3-ASR,在 Apple Silicon 上本地完成音频转录。适用于会议录音、语音备忘录、播客等场景——无需上传至云端,亦无需支付 Whisper API 费用。
curl http://localhost:11435/api/transcribe -F "file=@apple_silicon_meeting.wav" -F "model=qwen3-asr"
支持 WAV、MP3、M4A、FLAC 格式。在 Apple Silicon M4 Ultra 上处理一段 30 秒音频耗时约 2 秒。
使用 Ollama 嵌入模型(如 nomic-embed-text、mxbai-embed-large、snowflake-arctic-embed)在 Apple Silicon 集群上分布式生成文档嵌入向量。
curl http://localhost:11435/api/embed
-d '{"model": "nomic-embed-text", "input": "Apple Silicon 统一内存架构在 AI 推理中的应用"}'
支持跨 Apple Silicon 节点批量处理数千份文档,避免单台 Mac 成为性能瓶颈。
访问 http://localhost:11435/dashboard,即可查看集群中所有 Apple Silicon Mac 的实时状态:已加载模型、队列深度、温度状态、内存使用率及健康状况。
curl http://localhost:11435/fleet/status
返回所有 Apple Silicon 节点的硬件规格、已加载模型、图像生成/语音转文字能力以及各项健康指标。
curl http://localhost:11435/dashboard/api/health
执行 15 项自动化检查:离线节点检测、内存压力、温度降频、VRAM 回退、错误率等。
| 你的 Apple Silicon Mac | 内存容量 | 推荐模型 |
|---|---|---|
| Mac Mini(16GB) | 16GB | llama3.2:3b、phi4-mini、nomic-embed-text |
| Mac Mini(32GB) | 32GB | qwen3:14b、deepseek-r1:14b、llama3.3:8b |
| MacBook Pro(36–64GB) | 36–64GB | qwen3:32b、deepseek-r1:32b、codestral |
| Mac Studio(128GB) | 128GB | llama3.3:70b、qwen3:72b、deepseek-r1:70b |
| Mac Studio/Pro(192–256GB) | 192–256GB | qwen3:110b、deepseek-v3:236b(量化版) |
Apple Silicon 路由器内置的模型推荐器会分析你集群的硬件配置,并建议最优模型组合:GET /dashboard/api/model-recommendations。
~/.fleet-manager/latency.db(Apple Silicon 路由指标)和 ~/.fleet-manager/logs/herd.jsonl(结构化日志)。未经用户确认,不得删除或修改这些文件。