凌晨两点,把模型留在本机
凌晨两点半,窗外的雨敲着空调外机,像有人在低声试麦。我坐在一台普通的 Windows 台式机前,浏览器里还停着“Claude怎么用”“Claude免费使用”的搜索页。云端AI很好,可有些时候,合同草稿、访谈纪要、内部表格,并不适合被一键上传。于是问题变得很朴素:能不能把一个够用的大模型,安安静静放在自己的电脑里?这就是这篇 Ollama部署教程 和 LM Studio教程 要解决的事。
先说硬件底线。我实测的机器是 Ryzen 5 5600、32GB 内存、RTX 3060 12GB,系统 Windows 11。7B 量级模型基本流畅,14B 能跑但等待感明显;如果只有 16GB 内存,建议从 4-bit 量化的 7B 模型开始。没有独显也能用 CPU 跑,只是首字响应可能从 1-3 秒变成 10 秒以上。技术有时像夜车,不是不走,只是速度不同。
Ollama:命令行更干净,适合长期使用
先做免费官方路径。搜索 Ollama下载,安装 Windows 或 macOS 版本;Linux 可用官方安装脚本。安装后打开终端,先确认服务可用:
ollama --version
ollama run qwen2.5:7b
第一次运行会下载模型,qwen2.5:7b 的量化版本通常约 4.7GB。家用 100Mbps 宽带实际下载约 8-15 分钟,取决于线路。下载完成后输入“总结一下本地部署大模型的优缺点”,如果模型开始逐字回复,说明基础链路通了。
我常用这三个模型做起步测试:qwen2.5:7b 适合中文问答和办公摘要;llama3.1:8b 英文和代码解释更稳;deepseek-r1:7b 适合推理类问题,但会输出较长思考过程。想让其他工具调用 Ollama,可以测试本地 API:
curl upstream -d "{\"model\":\"qwen2.5:7b\",\"prompt\":\"用三句话解释蒸发仪的作用\",\"stream\":false}"
如果返回 JSON,并且 response 字段里有文本,就是可被自动化脚本、知识库工具或本地办公流调用的状态。这里的关键不是“炫”,而是可控:模型在本机,端口在本机,数据也停在本机。
LM Studio:图形界面更友好,适合边试边换模型
如果你不喜欢命令行,LM Studio下载 后安装即可。打开软件,在搜索框输入 qwen2.5、llama 或 mistral,优先选择 GGUF 格式、Q4_K_M 或 Q5_K_M 量化版本。我的经验是,Q4_K_M 速度和质量更平衡,7B 模型显存占用约 5-6GB;Q8 精度更高,但普通显卡压力会明显上升。
下载后进入 Chat 页面,加载模型,先问一个与你真实工作接近的问题,比如“把下面会议纪要整理成待办事项,按负责人分类”。这比问诗歌、笑话更能判断模型是否可用。若回复慢,优先换更小模型,而不是反复调参数。Temperature 建议 0.3-0.7;上下文长度如果设到 8192,内存占用会上升,旧电脑可先用 4096。
LM Studio 还可以打开本地服务器模式,兼容 OpenAI API 风格。开启 Local Server 后,默认地址通常是:
http://localhost:1234/v1/chat/completions
这一步适合把本地模型接入写作工具、代码编辑器或内部小脚本。与 Ollama 相比,LM Studio 的优势是选模型直观;限制是批量管理和后台自动化不如命令行顺手。两者不冲突,一个像收音机旋钮,一个像调音台。
怎么确认真的部署好了
最后做一个短验证。第一,断开网络,分别在 Ollama 或 LM Studio 里提问,若仍能回复,说明模型本地可用。第二,用任务管理器观察 GPU 或内存占用,提问时 RTX 3060 显存从约 1GB 升到 6GB 左右,说明模型确实被加载。第三,连续问三次同一份 500 字材料摘要,我实测 qwen2.5:7b 首字约 1.8 秒,完整摘要约 9 秒;若超过 60 秒,通常是模型过大或没有启用 GPU 加速。
如果你是因为 Claude注册方法 或 Claude不可用才转向本地大模型,要接受一个现实:本地 7B 模型不等于顶级云端模型,但它足够处理许多私密、重复、低成本的日常任务。睿盈工具也会继续整理这类免费、官方、DIY优先的 AI生产力路径;需要更多工具线索时,upstream 可以作为一个补充入口。夜深时,把一部分智能留在自己的机器里,未必浪漫,却让人心里更稳。