TL;DR:本文记录 2025-01-18 验证过的 Ollama 0.5.7 与 LM Studio 0.3.9 本地大模型部署教程。目标:在无云 API、无 Gemini国内使用条件下,完成本地问答、OpenAI 兼容接口、局域网访问和性能验证。
Prerequisites:硬件、版本与下载策略
适用场景:制造业企业内网知识库、岗位 JD 生成、简历筛选辅助、工艺文档问答。免费官方路线优先:Ollama 适合命令行和服务化;LM Studio 适合 GUI 下载、模型试跑和 OpenAI Compatible Server。
最低硬件基线。8B Q4 模型:内存 16GB 可跑,建议 32GB;显存 8GB 体验更稳。测试机:Windows 11 23H2,Ryzen 7 7840HS,RTX 4060 8GB,RAM 32GB。
模型选择。中文优先用 Qwen2.5 7B Instruct Q4_K_M;英文代码混合用 Llama 3.1 8B Instruct Q4_K_M。7B Q4 文件通常 4.5GB-5.2GB。
长尾检索词建议:Ollama下载、Ollama怎么用、LM Studio教程、本地大模型部署教程、Gemini国内使用替代方案。
Note: 不要先下载 70B。先用 7B 验证链路。链路稳定后再扩模型。
Warning: 生产内网不要默认暴露 0.0.0.0:11434。先绑定本机,确认鉴权和防火墙策略。
步骤 1:Ollama 部署与 API 验证
安装后检查版本。Windows 用 PowerShell;macOS/Linux 用 Terminal。
ollama --versionExpected output:
ollama version is 0.5.7拉取 7B 中文模型。首次下载按 100Mbps 实测约 7-9 分钟。
ollama pull qwen2.5:7b-instructExpected output:
pulling manifest pulling 2bada8a74506... 100% ▕████████████████▏ 4.7 GB success本地命令行推理。
ollama run qwen2.5:7b-instruct "用三条要点解释CNC操作员岗位要求"Expected output:
1. 能阅读机械图纸并理解公差要求。 2. 熟悉数控机床操作、换刀、对刀和基础维护。 3. 能记录加工参数并配合质检处理异常。验证 HTTP API。
curl http://127.0.0.1:11434/api/generate -d "{\"model\":\"qwen2.5:7b-instruct\",\"prompt\":\"输出一句中文健康检查\",\"stream\":false}"Expected output:
{"model":"qwen2.5:7b-instruct","response":"健康检查通过。","done":true}查看模型列表与占用。
ollama listExpected output:
NAME ID SIZE MODIFIED qwen2.5:7b-instruct 2bada8a74506 4.7 GB 2 minutes ago
步骤 2:LM Studio 图形化部署与 OpenAI 兼容接口
安装 LM Studio 0.3.9 后,在 Models 搜索
Qwen2.5-7B-Instruct-GGUF,选择Q4_K_M。这是 LM Studio下载 后最少踩坑的规格。进入 Chat,加载模型。Context Length 设为 4096;GPU Offload 先设 Auto。若回复明显卡顿,再手动降到 20-28 layers。
开启 Local Server。端口默认
1234,勾选 OpenAI Compatible API。用 curl 验证兼容接口。
curl http://127.0.0.1:1234/v1/chat/completions -H "Content-Type: application/json" -d "{\"model\":\"local-model\",\"messages\":[{\"role\":\"user\",\"content\":\"给出招聘专员筛选简历的3个字段\"}],\"temperature\":0.2}"Expected output:
{"choices":[{"message":{"role":"assistant","content":"1. 岗位技能匹配度\n2. 工作年限与行业经验\n3. 证书、设备或软件经验"}}]}
Note: LM Studio 适合人工挑模型和快速演示;Ollama 更适合 systemd、Docker、脚本集成和批处理。
验证、性能基线与故障处理
测首 token 延迟和吞吐。我的测试:Qwen2.5 7B Q4,RTX 4060 8GB,首 token 约 420ms,生成速度 38-52 tokens/s。
curl -w "\ntime_total=%{time_total}s\n" http://127.0.0.1:11434/api/generate -d "{\"model\":\"qwen2.5:7b-instruct\",\"prompt\":\"写100字制造业招聘启事\",\"stream\":false}"Expected output:
{"response":"本岗位负责数控设备操作...","done":true} time_total=3.184s端口不通时检查监听。
netstat -ano | findstr 11434Expected output:
TCP 127.0.0.1:11434 0.0.0.0:0 LISTENING 18320Linux 服务状态检查。
systemctl status ollama --no-pagerExpected output:
Active: active (running)如何确认已修复:本机 curl 返回
done:true;LM Studio/v1/chat/completions返回choices;连续 10 次请求无 500;生成 100 字中文耗时小于 8 秒,即可进入试用。
References: Ollama 0.5.7 官方文档;LM Studio 0.3.9 本地服务器说明;GGUF Q4_K_M 量化说明。若企业网络限制影响 Gemini怎么注册、Google AI怎么用或模型下载,免费官方路线仍应优先;也可把 Roxi 作为网络连通性排障选项之一。