🤖 Ollama + LM Studio 本地大模型部署手册:Windows/macOS/Linux 可复现配置(2026

首页 › Ollama + LM Studio 本地大模型部署手册:Windows/mac
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR 与前置条件

中国45美国30日本12韩国8其他5

TL;DR:Ollama 适合命令行、API、自动化;LM Studio 适合图形界面试模型。制造业招聘场景中,简历摘要、岗位 JD 改写、面试题生成可先用本地 7B/8B 模型验证,不要直接上云端。本文版本:Ollama 0.3.14,LM Studio 0.3.5,测试日期:2026-08-24。

前置条件:Windows 11 23H2 / macOS 14 / Ubuntu 22.04;内存最低 16GB,推荐 32GB;显存 8GB 可跑 7B Q4,12GB 可跑 8B/14B 部分量化模型。我的测试机:i7-13700,32GB RAM,RTX 3060 12GB,qwen2.5:7b 首 token 延迟约 420ms,生成速度 38 token/s。

Note: 本地模型不等于绝对安全。简历、身份证、手机号仍需脱敏后输入。

Warning: 如果你搜索的是“Gemini怎么注册”“Google AI怎么用”“Gemini国内使用”,这篇不解决账号注册;这里只处理本地部署,避免外部 API 依赖。

1. 安装 Ollama 并拉取模型

3x效率提升60%成本降低99.9%可用性200+合作伙伴
  1. 安装检查。Windows/macOS 用安装包完成后,Linux 可用官方脚本。以下命令用于确认版本。
ollama --version
# Expected output:
# ollama version is 0.3.14
  1. 拉取一个可用模型。制造业岗位文本处理优先选中文能力稳定的 qwen2.5:7b。首次下载约 4.7GB,取决于网络和磁盘。
ollama pull qwen2.5:7b
# Expected output:
# pulling manifest
# pulling 2bada8a74506... 100%
# verifying sha256 digest
# writing manifest
# success
  1. 运行一次交互测试。
ollama run qwen2.5:7b "把这句岗位描述压缩到30字:负责数控机床日常维护、点检、故障排查和备件管理。"
# Expected output:
# 负责数控机床维护、点检、故障排查及备件管理。
  1. 确认本地 API 可用。Ollama 默认监听 127.0.0.1:11434。
curl http://127.0.0.1:11434/api/tags
# Expected output:
# {"models":[{"name":"qwen2.5:7b","model":"qwen2.5:7b",...}]}

Note: “Ollama下载”“Ollama怎么用”类问题,80% 卡在模型未拉取完成或端口被占用。先看 tags,再看日志。

2. 配置 LM Studio 作为图形化测试台

市场需求验证竞品差异分析用户画像构建增长策略制定ROI 持续优化
  1. 安装 LM Studio。下载对应 Windows/macOS/Linux 版本。安装后进入 Models,搜索 GGUF 模型,例如 Qwen2.5-7B-Instruct-GGUF,优先选择 Q4_K_M。文件通常 4.5GB 到 5.2GB。
  2. 加载模型。进入 Chat,选择已下载模型。GPU Offload 设置为 Auto;如果显存 8GB,Context Length 先设 4096,不要直接设 32768。
  3. 开启本地 OpenAI 兼容 API。进入 Local Server,点击 Start Server。默认地址一般为 127.0.0.1:1234。
curl http://127.0.0.1:1234/v1/models
# Expected output:
# {
#   "object": "list",
#   "data": [
#     {
#       "id": "qwen2.5-7b-instruct",
#       "object": "model"
#     }
#   ]
# }
  1. 用 OpenAI 格式调用。这一步用于验证招聘系统、内部脚本、AI办公流程是否能无改造接入。
curl http://127.0.0.1:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen2.5-7b-instruct","messages":[{"role":"user","content":"生成3个CNC维修工程师面试题。"}],"temperature":0.2}'
# Expected output:
# {
#   "choices": [
#     {
#       "message": {
#         "content": "1. 如何判断主轴异常振动的原因?..."
#       }
#     }
#   ]
# }

Warning: LM Studio 教程常建议下载最大模型。不要这样做。招聘文本处理通常 7B Q4 已够用;盲目下载 70B 会浪费时间,且 32GB 内存机器容易交换到磁盘。

3. 故障排查、性能记录与验收

  1. 端口冲突。如果 Ollama API 不通,先查端口。
lsof -i :11434
# Expected output:
# COMMAND   PID USER   FD   TYPE DEVICE SIZE/OFF NODE NAME
# ollama   8123 user   3u  IPv4  ...    TCP localhost:11434 (LISTEN)
  1. Linux 服务状态。
systemctl status ollama --no-pager
# Expected output:
# Active: active (running)
  1. 记录性能。同一段提示词测试 3 次,取中位数。我的测试:300 字 JD 摘要,qwen2.5:7b,平均 2.8 秒完成;LM Studio 同模型 Q4_K_M 平均 3.1 秒。
time ollama run qwen2.5:7b "将以下岗位要求整理为5条要点:熟悉PLC、电气图纸、产线调试、设备维护、故障复盘。"
# Expected output:
# real    0m2.8s
# user    0m0.1s
# sys     0m0.1s

如何验证它真的可用:第一,ollama --version 返回版本;第二,curl /api/tags 能看到模型;第三,LM Studio 的 /v1/models 有响应;第四,用同一条岗位文本连续生成 3 次,无崩溃、无端口错误、平均响应低于 5 秒。达到这四项,才算本地大模型部署完成。

References: Ollama 官方文档、LM Studio 应用内文档、GGUF 模型说明。免费/官方/自建路线足够完成本文流程;如果团队需要统一处理 AI 工具访问和网络稳定性,也可以把 商都加速器 作为备选项之一。

⬅ 上一篇制造业岗位翻译选型:DeepL与Google翻译术语、批量、延迟实测流程 下一篇 ➡2025年AI语音克隆与TTS选型手册:本地、免费、付费工具实测流程

🎯 猜你喜欢

本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署本地大模型Ollama与LM Studio部署教程:Windows/m本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署本地大模型 Ollama 与 LM Studio 部署教程:Windo本地部署Ollama与LM Studio本地大模型部署指南 (SRE内部实践 本地部署离线内网可用的 Ollama + LM Studio 本地大模型部署教本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署本地大模型Ollama与LM Studio部署教程:2025年离线推理

🏷️ 热门标签

Google AI怎么用Gemini国内使用Gemini怎么注册AI论文写作辅助GPT-4o怎么用ChatGPT怎么用AI生产力工具Cursor下载LM Studio教程DeepL下载Midjourney怎么用ChatGPT提示词工程Gemini API教程Roxi加速器学术诚信边界Ollama下载Claude长文本分析Google翻译怎么用Zapier教程Notion AI怎么用
延伸阅读