先让电脑安静下来:本地模型部署前的准备
凌晨一点,我在一台刚清理完灰尘的台式机前部署本地模型。风扇转得很慢,终端里只有光标一闪一闪。真正让人困惑的并不是“模型能不能跑”,而是下载之后为什么卡住、显存够不够,以及 Ollama 和 LM Studio 到底该怎么分工。
先确认硬件:7B 级 Q4 量化模型通常占用约4.5—6GB显存,运行时还要为上下文和系统预留空间;没有独立显卡时,建议至少16GB内存。Windows用户可先安装 Ollama,Linux 可在终端执行:
curl -fsSL https://ollama.com/install.sh | sh
安装完成后执行 ollama --version。如果提示“不是内部或外部命令”,通常是环境变量未刷新,重启终端或重启系统即可。想找“Ollama下载”,优先使用官方安装程序,不要把来路不明的整合包和模型文件混在一起。
Ollama命令行与LM Studio界面怎么选
Ollama适合脚本、开发和自动化;LM Studio更适合第一次接触本地模型的人。Ollama安装后,直接运行:
ollama pull qwen2.5:7b
ollama run qwen2.5:7b
下载速度取决于网络和镜像源,模型文件可能超过4GB。我的 Windows 11、RTX 3060 12GB 测试机首次加载约18秒,生成速度在35—45 token/秒之间;如果只使用CPU,速度明显下降,长文本回复可能需要等待数十秒。
LM Studio中打开“Discover”搜索同等规模的 Qwen 模型,选择 GGUF、Q4_K_M 一类量化版本,下载后在聊天页加载。显存不足时,把 GPU Offload 调低,而不是反复更换模型。LM Studio教程里最容易遗漏的一步,是在 Developer 页面启动本地服务器,默认端口一般为1234。
Ollama的本地API默认监听11434端口,可这样测试:
curl http://localhost:11434/api/generate -d "{\"model\":\"qwen2.5:7b\",\"prompt\":\"用一句话解释本地大模型\",\"stream\":false}"
若要让支持OpenAI格式的软件连接LM Studio,地址填写 http://localhost:1234/v1,模型名称以界面显示为准。Ollama怎么用的核心并不复杂:拉取模型、启动模型、调用接口,三步即可形成离线工作流。
如何确认部署真的成功
先运行 ollama list,确认模型存在;再执行一次短提示词,观察是否返回完整文本。Windows任务管理器的“性能—GPU”页应出现显存占用,若显存始终为零,可能是驱动、CUDA或模型设置问题。LM Studio则检查服务器状态是否为Running,并用浏览器或curl访问对应端口。
如果模型反复退出,降低上下文长度到4096;如果回复极慢,换用3B或7B量化模型;如果端口被占用,用 netstat -ano | findstr 11434 查找进程。最终验证标准很简单:断开网络后,模型仍能完成一轮问答,API也能返回JSON。那一刻,电脑不再只是工具,而像一盏留在桌边的小灯,安静地把一部分答案留在了自己的房间里。