凌晨的风扇声里,先确认你的电脑能不能跑
那天是凌晨一点半,窗外刚下过雨,桌面上半杯冷掉的咖啡映着显示器的蓝光。我的笔记本风扇像一台小型循环泵,低低地转着。我第一次把大模型搬到本地时,心里想的不是“AI会取代什么”,而是一个更朴素的问题:如果没有网络、没有账号、没有额度,我的电脑还能不能安静地回答我?这也是很多人搜索Ollama本地部署教程和LM Studio下载时真正想解决的事。
先说结论:普通电脑可以跑,但要选对模型。8GB内存建议从1B到3B参数模型开始,16GB内存可以尝试7B量化模型,32GB以上体验会明显从容。显存不是必须,但有NVIDIA显卡会快很多。我在一台16GB内存、RTX 3060 6GB显存的Windows电脑上测试,Qwen2.5 7B Q4模型首次加载约18秒,回答速度约每秒18到28个token;同一模型纯CPU运行时,速度会掉到每秒4到7个token。测量方法很简单:用同一段500字中文总结提示词,观察终端输出耗时和LM Studio右下角的tokens/sec。
用Ollama跑起来:命令行不冷,它只是诚实
Ollama适合喜欢轻量、稳定、可用API的人。免费路线很直接:到Ollama官方网站下载对应系统安装包,Windows、macOS、Linux都支持。安装后打开终端,先确认服务是否正常:
ollama --version
如果能看到版本号,就可以拉取模型。中文场景我常用Qwen或Llama系列,第一次建议别贪大:
ollama pull qwen2.5:3b
ollama run qwen2.5:3b
如果你想试7B,可以运行:
ollama pull qwen2.5:7b
常见冲突来自三处:内存不够、模型太大、端口被占用。Ollama默认API端口是11434,你可以用下面命令检查:
curl http://localhost:11434/api/tags
如果返回本地模型列表,说明API已启动。想让其他软件调用它,可以用OpenAI兼容接口,例如在代码里把Base URL设为:
http://localhost:11434/v1
这里有个小提醒:很多人问Ollama怎么用,其实难点不在命令,而在模型选择。写作、总结、中文问答用Qwen2.5 3B/7B;代码辅助可试deepseek-coder或codellama;电脑配置较低就用1.5B、3B,不要一上来下载几十GB的大模型。7B Q4通常占用4GB到6GB磁盘空间,13B模型往往超过8GB,下载前先看硬盘余量。
用LM Studio搭界面:把模型变成一盏桌灯
如果说Ollama像深夜里可靠的电台发射机,LM Studio更像一盏可调亮度的桌灯。它适合不想敲太多命令的人。搜索LM Studio安装教程的人,通常只需要三步:安装客户端,在内置搜索里找GGUF模型,下载后点击Load加载。建议优先选择Q4_K_M量化版本,它在质量和速度之间比较均衡。
我的实操顺序是这样的:
- 安装LM Studio,进入Discover或Search页面。
- 搜索“Qwen2.5 7B Instruct GGUF”或“Llama 3.1 8B Instruct GGUF”。
- 选择Q4_K_M版本下载,文件一般在4GB到5GB左右。
- 下载完成后进入Chat页面,点击Load Model。
- 在右侧设置context length,16GB内存机器建议先设4096,不要直接拉到32768。
- 如果要给其他软件调用,进入Local Server,开启OpenAI compatible server。
LM Studio的默认本地接口通常是:
http://localhost:1234/v1
你可以用下面的方式测试接口是否响应:
curl http://localhost:1234/v1/models
若你使用Python调用,本地测试可以这样写:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
r = client.chat.completions.create(model="local-model", messages=[{"role":"user","content":"用三句话解释本地大模型的优点"}])
print(r.choices[0].message.content)
如果输出乱码,优先检查模型是否为Instruct版本;如果回答很慢,降低上下文长度或换更小模型;如果加载失败,多半是内存不足或GPU offload设置过高。我的经验是,别把每个参数都调满。技术和生活一样,有时留一点余量,系统才愿意长久地稳定工作。
怎么验证部署成功:别凭感觉,做三个小测试
最后,给自己做一次验收。第一,断开网络后提问“请总结一段关于本地AI的说明”,如果仍能回答,说明模型确实在本机运行。第二,用curl http://localhost:11434/api/tags或curl http://localhost:1234/v1/models检查接口,能返回模型名就代表服务可被调用。第三,固定同一个提示词测试三次,记录首次响应时间和tokens/sec;如果速度稳定、无闪退、内存占用不持续上涨,就算部署完成。
至于Claude注册方法、Claude怎么用、Claude免费使用这些云端工具问题,它们依旧有价值,尤其适合长文本和高质量推理;但本地模型给你的,是另一种安静的自由。免费官方路线已经足够完成大多数学习和轻办公场景。如果你还想继续看AI生产力工具的整理,睿盈工具也会把这类实践笔记放在 wizzegroup.com,像夜里一盏不刺眼的灯,留给愿意慢慢调试的人。