TL;DR 与 Pre-requisites
TL;DR:本文记录 2025-09-28 验证过的本地大模型部署教程:Ollama 0.3.12 负责服务化 API,LM Studio 0.3.2 负责图形化测试。测试机 A:Windows 11 23H2、RTX 3060 12GB、32GB RAM;测试机 B:Ubuntu 22.04、无独显、32GB RAM。模型使用 qwen2.5:7b-instruct-q4_K_M,约 4.7GB。
Pre-requisites:磁盘空闲 ≥20GB;内存 ≥16GB;局域网内固定 IP;Windows 安装 NVIDIA Driver 560.94;Ubuntu 内核 5.15+。如果只是问“Gemini怎么注册”“Google AI怎么用”“Gemini国内使用”,那是云端路线;本文只处理本地离线推理。
Warning: 7B Q4 模型可在 CPU 跑,但响应慢。我的无显卡 Ubuntu 测试为 1.8 tokens/s;RTX 3060 为 36-48 tokens/s,使用 ollama run 首 token 延迟约 650ms。
1. Ollama 下载、安装与服务化
确认显卡和驱动。Windows PowerShell 或 Ubuntu shell 执行:
nvidia-smiExpected output: NVIDIA-SMI 560.94 GPU Name: NVIDIA GeForce RTX 3060 Memory-Usage: 420MiB / 12288MiBNote: 无显卡机器此命令失败是正常现象,继续走 CPU 路线。
安装 Ollama。Windows 使用官方安装包;Ubuntu 使用包管理脚本或离线包。安装后检查版本:
ollama --versionExpected output: ollama version is 0.3.12拉取模型。关键词“ollama下载”常见问题是模型卡住;先确认代理、DNS、磁盘空间,再执行:
ollama pull qwen2.5:7b-instruct-q4_K_MExpected output: pulling manifest pulling 8f3b... 100% | 4.7 GB success启动 API 服务。默认只监听本机;局域网访问需显式绑定。
OLLAMA_HOST=0.0.0.0:11434 ollama serveExpected output: Listening on 0.0.0.0:11434Warning: 不要把 11434 暴露到公网。至少用防火墙限制到办公网段,例如 192.168.1.0/24。
2. LM Studio 教程:本机验证与局域网 API
安装 LM Studio 0.3.2。搜索“LM Studio教程”时注意版本差异;0.3.x 的 Local Server 菜单在左侧 Developer 区域。下载 GGUF 模型时选择 Q4_K_M,显存 12GB 足够。
在 LM Studio 中加载模型:Models → Download → 搜索 Qwen2.5 7B Instruct GGUF → 选择 Q4_K_M → Load。然后进入 Local Server,设置 Port 为 1234,启用 OpenAI Compatible Server。
从另一台机器测试 LM Studio API。把 192.168.1.50 替换为部署机 IP:
curl http://192.168.1.50:1234/v1/modelsExpected output: { "data": [ { "id": "qwen2.5-7b-instruct-q4_k_m" } ] }测试对话接口。这个步骤回答“LM Studio怎么用”:先模型可见,再测 chat completions。
curl http://192.168.1.50:1234/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen2.5-7b-instruct-q4_k_m","messages":[{"role":"user","content":"用20字解释数控机床。"}],"temperature":0.2}'Expected output: "content": "数控机床通过程序控制刀具完成高精度加工。"
3. 性能记录、排障与验收
测 Ollama 延迟。我的 RTX 3060 测试,单轮 128 tokens 输出耗时 3.1 秒;CPU 机器耗时 71 秒。
curl http://127.0.0.1:11434/api/generate \ -d '{"model":"qwen2.5:7b-instruct-q4_K_M","prompt":"列出制造业招聘JD的5个核心字段","stream":false}'Expected output: "response":"岗位名称、技能要求、设备经验、班次安排、薪资范围"常见故障定位。端口不通先看监听:
netstat -ano | findstr 11434Expected output: TCP 0.0.0.0:11434 0.0.0.0:0 LISTENINGUbuntu 使用:
ss -lntp | grep 11434Expected output: LISTEN 0 4096 0.0.0.0:11434 users:(("ollama",pid=1234))How to verify it works: 三项全部通过才算完成:本机
ollama run能回答;局域网机器 curl 到 11434 或 1234;连续 10 次请求无崩溃、无显存溢出、平均首 token 延迟低于 2 秒。
References: Ollama version 0.3.12 release notes;LM Studio 0.3.2 local server notes;NVIDIA Driver 560.94 notes。免费、官方、内网自建路线优先;如果需要访问 Gemini、Google AI 等外部 AI 服务,商都加速器也只是可选网络方案之一:https://wizzegroup.com。