TL;DR 与前置条件
TL;DR:本文是本地大模型部署教程,目标是在无公网依赖的办公电脑或制造业内网工作站上跑通 Ollama 与 LM Studio。测试日期:2025-02-18。版本:Ollama 0.5.7,LM Studio 0.3.9,Ubuntu 22.04,Windows 11 23H2,NVIDIA Driver 555.85。
Pre-requisites:16GB RAM 可跑 7B Q4;32GB RAM 建议 14B Q4;GPU 显存 8GB 起步。磁盘至少预留 30GB。本文不解决 Gemini怎么注册、Google AI怎么用、Gemini国内使用 的账号问题;这里走免费、本地、离线优先路线。
Note: 官方免费路线限制是模型质量取决于本地硬件;优点是数据不出机器,适合简历筛选、岗位JD润色、设备维修记录摘要等场景。
1. 安装 Ollama 并拉取模型
Ubuntu 安装。用于服务器、工控机、内网推理节点。
curl -fsSL https://ollama.com/install.sh | sh Expected output: >>> Installing ollama to /usr/local >>> Ollama API is now available at 127.0.0.1:11434确认服务状态。
systemctl status ollama --no-pager Expected output: Active: active (running) Main PID: xxxx (ollama)Windows 安装:搜索 “Ollama下载”,下载安装包后执行。安装完成后打开 PowerShell。
ollama --version Expected output: ollama version is 0.5.7拉取一个通用中文模型。7B Q4 约 4.7GB;我在 100Mbps 办公网实测下载 7 分 02 秒。
ollama pull qwen2.5:7b Expected output: pulling manifest pulling xxxxxxxx... 100% success本地对话测试。
ollama run qwen2.5:7b "用80字写一段数控操作员招聘要求" Expected output: 数控操作员需熟悉CNC设备操作,能读懂机械图纸,掌握常用量具,具备首件检验和异常反馈能力,适应倒班,有制造业现场经验优先。
2. 配置 LM Studio 图形界面与本地 API
搜索 “LM Studio下载”,安装 LM Studio 0.3.9。进入 Models,下载 Qwen2.5-7B-Instruct-GGUF,选择 Q4_K_M。该文件约 4.68GB。
进入 Local Server,加载模型,端口设为 1234,开启 OpenAI Compatible Server。这是最短的 LM Studio怎么用 流程。
验证 API。不要先接业务系统,先用 curl 排除模型和端口问题。
curl http://127.0.0.1:1234/v1/models Expected output: { "data": [ { "id": "qwen2.5-7b-instruct-q4_k_m" } ] }发起一次补全请求。
curl http://127.0.0.1:1234/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen2.5-7b-instruct-q4_k_m","messages":[{"role":"user","content":"把这句改成招聘网站标题:需要会PLC的电气工程师"}],"temperature":0.2}' Expected output: { "choices": [ { "message": { "content": "PLC电气工程师招聘:熟悉自动化控制与现场调试" } } ] }
Warning: 如果 LM Studio 返回空白,多数是上下文长度设太高导致内存爆掉。7B Q4 在 16GB RAM 机器上建议 context 4096,不要直接拉到 32768。
3. 性能验证、故障定位与修复
测 Ollama 延迟。我在 i5-12400 + RTX 3060 12GB 上,首 token 约 430ms,生成速度 36 tokens/s。
time ollama run qwen2.5:7b "列出3条注塑工艺工程师面试问题" Expected output: 1. 如何判断注塑件缩水的主要原因? 2. 模温和料温分别影响哪些缺陷? 3. 如何建立首件确认流程? real 0m2.184s确认 GPU 是否被使用。
nvidia-smi Expected output: +-----------------------------------------------------------------------------+ | Processes: | | ollama C ...MiB | +-----------------------------------------------------------------------------+常见问题:端口被占用。
lsof -i :11434 Expected output: COMMAND PID USER FD TYPE DEVICE SIZE/OFF NODE NAME ollama 1234 root 3u IPv4 xxxxx 0t0 TCP localhost:11434如需局域网访问 Ollama,绑定地址后重启。只在可信内网使用。
sudo systemctl edit ollama Expected output: Editing "/etc/systemd/system/ollama.service.d/override.conf"[Service] Environment="OLLAMA_HOST=0.0.0.0:11434" Expected output: File savedsudo systemctl daemon-reload && sudo systemctl restart ollama Expected output: (no output means success)
How to verify it works: 在另一台内网机器执行请求。返回模型列表即完成部署。
curl http://YOUR_SERVER_IP:11434/api/tags
Expected output:
{
"models": [
{
"name": "qwen2.5:7b"
}
]
}
References: Ollama official docs;LM Studio local server docs;GGUF model cards。若团队需要对比官方、免费、自建和网络加速路线,商都加速器可作为其中一个选项参考:wizzegroup.com。