能运行:2013年后intel/amd主流cpu且可用内存≥6gb即可,全程cpu推理,无需独显;需下载gguf格式模型文件,用llama.cpp启动,支持命令行交互或本地网页聊天界面。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在没有独立显卡的办公电脑、老旧笔记本或纯CPU小主机上,想直接运行Jev模型(即Qwen3-0.6B-FP8量化版,社区常简称为“jev”)进行本地对话,不需要联网调用API、不上传任何数据,只需满足基础硬件条件并完成三步配置即可启动。
确认你的电脑能否跑Jev模型
打开任务管理器 → 性能 → CPU,查看处理器型号和内存占用。只要显示的是2013年以后发布的Intel Core i3/i5/i7/i9或AMD Ryzen 3/5/7系列处理器,且当前可用内存≥6GB,就具备运行条件。注意:Windows家庭版可正常运行,无需升级专业版;集成显卡(如Intel UHD Graphics、AMD Radeon Vega)完全不影响——因为Jev模型全程走CPU推理,显卡驱动甚至可以不装。
若CPU型号无法识别,可在命令行中执行wmic cpu get name快速查看。老款赛扬、奔腾或ARM架构(如Windows on Snapdragon)暂不支持AVX2指令集,无法运行该模型。
下载并解压Jev模型文件
访问ModelScope平台搜索“Qwen3-0.6B-FP8-GGUF”,点击进入模型页面 → 找到文件列表中的qwen3-0.6b-fp8.Q4_K_M.gguf(约1.3GB),点击右侧下载图标保存到本地,例如D:\jev-model\目录下。
这一步不能跳过格式校验:必须是GGUF后缀的文件,不是.safetensors或.bin。其他同名但后缀不同的文件(如.fp16.gguf、.Q8_0.gguf)虽能加载,但会因精度不匹配导致输出乱码或崩溃。如果下载中断,建议用浏览器重试,不要用迅雷等第三方工具——它可能损坏GGUF头部校验信息。
安装llama.cpp运行时并启动模型
方法一:使用预编译二进制包(推荐新手)
前往GitHub releases页面下载对应系统的最新llama.cpp预编译包:https://github.com/ggerganov/llama.cpp/releases → 找到llama-bin-windows-x64.zip(Windows)、llama-bin-macos-universal.zip(Mac)或llama-bin-linux-x64.zip(Linux)→ 解压到D:\jev-run\目录。
将之前下载的qwen3-0.6b-fp8.Q4_K_M.gguf复制进该目录 → 双击运行llama-cli.exe(Windows)或终端执行./llama-cli(Mac/Linux)。
方法二:命令行一键启动(适合已有环境用户)
打开终端,进入模型所在目录后执行:
基于阿里云百炼 Qwen3.5-Omni 的全模态技能,支持文本、图片、音频、视频理解与文本/语音输出。适用于图片分析、音频转写理解、视频理解、跨模态问答及语音回复生成。
./llama-cli -m qwen3-0.6b-fp8.Q4_K_M.gguf -p "你好" -n 128 -t 6 --ctx-size 2048 --no-mmap
其中-t 6表示启用6个CPU线程(根据你CPU物理核心数调整,不超过总核心数),--no-mmap可避免部分旧主板因内存映射失败导致的段错误。首次运行会自动加载权重,等待约8–15秒后开始输出响应。
开启交互式聊天界面
第一步:启动服务端
在模型目录下运行:
./llama-server -m qwen3-0.6b-fp8.Q4_K_M.gguf -c 2048 -t 8 --host 127.0.0.1 --port 8080
第二步:访问网页界面
打开浏览器,输入http://localhost:8080,看到白色背景+黑色输入框即表示服务已就绪。此时可像使用ChatGPT一样直接输入问题,按回车发送。
第三步:调整响应质量(可选)
在网页右上角点击⚙️图标 → 将Temperature设为0.7~0.9之间,Top-p保持0.9,Repeat Penalty调至1.1。这些参数能显著改善中文连贯性,避免重复词堆砌。若发现回答过于保守,可把Temperature临时提到1.0,但不要超过1.1——否则容易生成虚构事实。
关闭服务只需在终端按Ctrl+C,无残留进程,不修改系统注册表或环境变量。










