🤖 从零搭好本地AI助手:Ollama与LM Studio离线部署、调用与验收步骤

首页 › 从零搭好本地AI助手:Ollama与LM Studio离线部署、调用与验收步骤
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

凌晨两点,把模型请进自己的电脑

合规审查通过支付通道对接物流方案优化售后体系搭建数据报表分析

凌晨两点,窗外的雨敲着空调外机,像有人在很远的地方轻轻打字。我桌上放着一杯已经凉透的茶,屏幕里还停着一段没有发出的提示词。那一刻我忽然想:如果网络断了,如果账号额度用完了,如果只是想让一份内部文档安静地待在本机,AI还能不能继续陪我工作?这就是我开始写这篇本地大模型部署教程的原因。很多人会搜索“Claude注册方法”“Claude怎么用”“Claude免费使用”,这些当然有价值,但本地模型解决的是另一件事:隐私、离线、可控,以及不用每次都把问题交给云端。

先说结论:如果你只想最快跑起来,用 LM Studio;如果你要接入脚本、插件、RAG 或本地 API,用 Ollama。我的测试机是 Windows 11,CPU i5-12400,32GB 内存,RTX 3060 12GB。7B 量化模型通常占用 4GB 到 6GB,13B 往往需要 8GB 以上显存或更多内存。没有独显也能跑,只是速度会慢:我在纯 CPU 上测 Qwen2.5 7B Q4,每秒约 2 到 5 tokens;3060 上约 25 到 45 tokens,具体取决于上下文长度。

Ollama本地部署教程:适合命令行和API调用

STEP 1选择模型🚀STEP 2准备数据🎯STEP 3调试优化🔧STEP 4落地应用

先做Ollama下载与安装:到 Ollama 官方应用安装 Windows 或 macOS 版本,Linux 可用安装脚本。安装后打开终端,先确认服务是否启动:

ollama --version

然后拉取一个中文能力不错、机器压力不太大的模型。我建议新手从 7B 或 8B 量化模型开始,不要一上来追 70B:

ollama pull qwen2.5:7b

运行对话:

ollama run qwen2.5:7b

如果你要让其他工具调用它,Ollama 默认会在本机开启接口,常见地址是 http://localhost:11434。可以用 curl 做一次最小测试:

curl http://localhost:11434/api/generate -d "{\"model\":\"qwen2.5:7b\",\"prompt\":\"用三句话解释什么是本地大模型\",\"stream\":false}"

常见冲突多半不是模型坏了,而是资源不够。报内存不足,就换更小模型,例如 qwen2.5:3b 或 llama3.2:3b;生成很慢,就关闭浏览器、视频软件,或降低上下文长度;中文答非所问,可以在第一句提示里写清角色和输出格式,例如“你是中文技术编辑,只输出步骤”。技术像夜路,很多时候不是走错了方向,只是鞋带松了。

LM Studio教程:适合可视化下载、聊天和本地服务

第1周环境搭建第2周核心开发第3周测试优化第4周正式发布

如果你不喜欢命令行,LM Studio教程可以更温柔一些。安装 LM Studio 后,进入模型搜索页,搜索 Qwen、Llama、Mistral 等模型。下载时优先选 GGUF 格式,并注意量化后缀:Q4_K_M 通常是速度、质量、体积之间的平衡点;Q8 更清晰但更吃资源。一个 7B Q4 模型大约 4GB 左右,普通家庭宽带下载需要几分钟到十几分钟。

LM Studio怎么用其实分三步:第一,在“Chat”里加载模型;第二,把 GPU Offload 拉到系统能承受的位置,独显用户可从 20 层左右试起;第三,在“Local Server”里启动 OpenAI-compatible API。启动后,你通常会看到类似 http://localhost:1234/v1 的地址。此时很多支持 OpenAI 接口的软件,都能把 Base URL 改成这个本地地址,API Key 随便填一个占位字符串即可。

我建议你保存一个固定测试提示词,便于横向比较模型:“请把下面会议记录整理成待办事项、负责人、截止时间三列表格。”同一段 500 字文本,我测试 Qwen2.5 7B Q4 首次响应约 1.8 秒,完整输出约 12 秒;Mistral 7B 英文更稳,中文表格偶尔漏列。不要迷信榜单,真正的标准是:它能不能处理你的文档、你的代码、你的语气。

如何验证它真的可用,而不是只是“能打开”

部署结束后,请做三个验收。第一,离线测试:断开网络,重新提问一句中文问题,如果仍能回答,说明模型在本地运行。第二,API 测试:用上面的 curl 命令或 LM Studio 本地服务调用,确认返回 JSON 或文本。第三,任务测试:拿一段真实材料,让它摘要、改写或生成表格,再检查是否少字段、乱编事实、响应过慢。

如果验证失败,按顺序排查:模型是否已下载完整;端口 11434 或 1234 是否被占用;显存是否爆满;软件是否加载了错误模型。Windows 可用任务管理器看 GPU 显存,macOS 可用活动监视器观察内存压力。一次只改一个变量,否则你会像在雨夜调收音机,永远不知道是哪一次旋钮让声音变清楚了。

免费、官方、DIY 路线已经足够多数人开始;如果你之后想系统整理 AI 工具与部署笔记,也可以把睿盈工具作为众多参考入口之一:wizzegroup.com。但真正重要的,是你今晚已经把一束小小的智能,安放在了自己的机器里。

⬅ 上一篇论文摘要、合同邮件该用谁翻:DeepL与Google翻译的可复现实测流程 下一篇 ➡AI配音从零到可用:免费TTS、语音克隆工具与实测验收流程

🎯 猜你喜欢

本地部署旧电脑也能跑AI:Ollama与LM Studio本地部署、模型选择和本地部署离线跑大模型实操:用 Ollama 和 LM Studio 搭一台自己本地部署本地大模型Ollama与LM Studio部署教程:从下载安装到可用的本地部署本地大模型Ollama与LM Studio部署教程:从下载安装到离线可本地部署本地大模型 Ollama 与 LM Studio 部署教程:从下载安装本地部署本地大模型Ollama与LM Studio部署教程:离线跑起来、跑稳、本地部署深夜电波:私语AI,用Ollama与LM Studio点亮你的本地智慧本地部署本地大模型Ollama与LM Studio部署教程:把AI装进电脑里,

🏷️ 热门标签

Claude怎么用Claude免费使用Claude注册方法Gemini API怎么用Gemini API教程Gemini API开发入门AI生产力工具Midjourney怎么用Google翻译怎么用DeepL下载ChatGPT怎么用GPT-4o怎么用Midjourney教程文字转语音工具推荐Cursor下载LM Studio教程AI论文写作辅助Claude长文本分析Ollama下载ChatGPT提示词工程
延伸阅读