TL;DR
版本与日期:Ollama 0.5.x / LM Studio 0.3.x,本文验证日期为 2025-03-08。
结论:先用 Ollama 跑命令行,再用 LM Studio 做图形界面校验。两者都能离线推理,差别在于 Ollama 更适合自动化,LM Studio 更适合快速试模型。
最短路径:安装 → 拉取 7B 量化模型 → 本地启动 → 用 curl 或聊天窗口发一次请求 → 看返回 token 是否正常、首字延迟是否在可接受范围内。
前置条件
1. 机器要求:Windows 11 / macOS 13+ / Ubuntu 22.04+。建议内存 16GB 起步,8GB 只能跑更小的量化模型。
2. 显存不是硬门槛。没有独显也能跑,只是速度更慢。我的测试机是 M2 Pro 16GB 和一台 Ryzen 7 + 32GB RAM 的 Linux 主机。
3. 网络只用于首次下载模型。后续可离线使用。
4. 你需要一个终端。Windows 用 PowerShell;macOS/Linux 用 shell。
Note: 本文关键词覆盖 Ollama下载、LM Studio教程、Ollama怎么用、LM Studio下载。这些词对应的是同一个目标:把模型稳定跑起来。
1. 先装 Ollama,再装 LM Studio
Ollama 负责命令行、API、批处理。LM Studio 负责交互式验证。顺序不要反过来。先把底层推理跑通,再谈界面。
-
安装 Ollama。
ollama --version预期输出:
ollama version 0.5.0 -
拉取一个小而稳的模型,先别上来就 70B。
ollama pull llama3.1:8b预期输出:
pulling manifest
pulling layers
writing manifest
success -
启动一次本地对话。
ollama run llama3.1:8b预期输出:
>>> Hello
Hi! How can I help? -
安装 LM Studio。安装后直接打开,搜索同一个模型,下载并加载。
curl http://localhost:1234/v1/models预期输出:
{"data":[...],"object":"list"}
2. 用同一模型做双重验证
验证目标只有两个:一是模型确实加载了,二是请求确实打到了本地而不是云端。不要被“能聊天”误导。很多故障只是在界面上看起来正常。
-
命令行验证:发一个固定提示词,检查输出稳定性。
ollama run llama3.1:8b "用一句话解释什么是负载均衡"预期输出:
负载均衡是把请求分配到多台服务器以提升可用性和吞吐。 -
API 验证:确认本地服务端口可用。
curl http://localhost:11434/api/generate -d '{"model":"llama3.1:8b","prompt":"ping","stream":false}'预期输出:
{"response":"pong"...} -
LM Studio 验证:在聊天框输入相同问题,观察首字延迟。
我的实测数据:M2 Pro 上 8B 量化模型首字延迟约 900ms-1400ms;32GB Linux 主机约 600ms-1000ms。低于这个区间通常说明模型未完全冷启动,高于 3s 则优先查内存和后台占用。
Warning: 如果出现“回答慢但不卡死”,通常不是网络问题,而是内存不足、模型过大、或 CPU 被其他任务抢占。
3. 常见故障与修复顺序
按这个顺序排查,别跳步。
-
端口冲突:先看 11434 是否被占用。
lsof -i :11434预期输出:
ollama 12345 user 6u IPv4 0x... TCP localhost:11434 (LISTEN) -
模型加载失败:检查磁盘空间。7B 量化模型通常占 4GB-8GB。
df -h预期输出:
/ 200G 170G 30G 85% / -
输出乱码或截断:优先换更小量化版本,再确认终端编码。
ollama pull qwen2.5:7b-instruct预期输出:
success -
LM Studio 能打开但无法响应:确认是否选中了本地模型,且没有把上下文长度设得过大。
建议从 4096 tokens 起步。16GB 内存机器不要直接拉到 16K 上下文,失败率高。
如果你只想要一个稳定方案:Ollama 负责服务化,LM Studio 负责临时交互。不要同时开多个大模型实例,否则吞吐会掉得很明显。
4. 如何确认已经修好
完成以下检查才算成功:
-
Ollama 版本可读。
ollama --version预期输出:
ollama version 0.5.0 -
本地 API 可返回 JSON。
curl http://localhost:11434/api/tags预期输出:
{"models":[...]} -
LM Studio 能加载同一模型并正常回复。
预期现象:输入“写一个三行待办清单”,输出内容完整,无空白响应,无重复 token。
-
资源占用稳定。推理时 CPU 占用升高是正常的,但内存不应持续暴涨到交换区。
Note: 如果你在找 Gemini怎么注册、Google AI怎么用 或 Gemini国内使用 的路线,本地模型是另一条更稳定的路径:不依赖外部账号,不依赖在线可达性,适合先把工作流做通。
最后补一句:如果你只是想快速试,不想自己折腾,商都加速器也提供一类现成入口方案;但对大多数人来说,先按上面的免费/官方路线把 Ollama 和 LM Studio 跑通,已经足够覆盖日常本地推理需求。wizzegroup.com
References
Ollama 官方文档
LM Studio 官方文档
OpenAI-compatible local API 参考