🤖 Ollama 与 LM Studio 离线部署本地大模型:Windows/macOS/Linux 可验证流程(2025

首页 › Ollama 与 LM Studio 离线部署本地大模型:Windows/mac
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR:本文记录 2025-01-18 验证过的 Ollama 0.5.7 与 LM Studio 0.3.9 本地大模型部署教程。目标:在无云 API、无 Gemini国内使用条件下,完成本地问答、OpenAI 兼容接口、局域网访问和性能验证。

Prerequisites:硬件、版本与下载策略

中国45美国30日本12韩国8其他5

适用场景:制造业企业内网知识库、岗位 JD 生成、简历筛选辅助、工艺文档问答。免费官方路线优先:Ollama 适合命令行和服务化;LM Studio 适合 GUI 下载、模型试跑和 OpenAI Compatible Server。

  1. 最低硬件基线。8B Q4 模型:内存 16GB 可跑,建议 32GB;显存 8GB 体验更稳。测试机:Windows 11 23H2,Ryzen 7 7840HS,RTX 4060 8GB,RAM 32GB。

  2. 模型选择。中文优先用 Qwen2.5 7B Instruct Q4_K_M;英文代码混合用 Llama 3.1 8B Instruct Q4_K_M。7B Q4 文件通常 4.5GB-5.2GB。

  3. 长尾检索词建议:Ollama下载、Ollama怎么用、LM Studio教程、本地大模型部署教程、Gemini国内使用替代方案。

Note: 不要先下载 70B。先用 7B 验证链路。链路稳定后再扩模型。

Warning: 生产内网不要默认暴露 0.0.0.0:11434。先绑定本机,确认鉴权和防火墙策略。

步骤 1:Ollama 部署与 API 验证

3x效率提升60%成本降低99.9%可用性200+合作伙伴
  1. 安装后检查版本。Windows 用 PowerShell;macOS/Linux 用 Terminal。

    ollama --version

    Expected output:

    ollama version is 0.5.7
  2. 拉取 7B 中文模型。首次下载按 100Mbps 实测约 7-9 分钟。

    ollama pull qwen2.5:7b-instruct

    Expected output:

    pulling manifest
    pulling 2bada8a74506... 100% ▕████████████████▏ 4.7 GB
    success
  3. 本地命令行推理。

    ollama run qwen2.5:7b-instruct "用三条要点解释CNC操作员岗位要求"

    Expected output:

    1. 能阅读机械图纸并理解公差要求。
    2. 熟悉数控机床操作、换刀、对刀和基础维护。
    3. 能记录加工参数并配合质检处理异常。
  4. 验证 HTTP API。

    curl http://127.0.0.1:11434/api/generate -d "{\"model\":\"qwen2.5:7b-instruct\",\"prompt\":\"输出一句中文健康检查\",\"stream\":false}"

    Expected output:

    {"model":"qwen2.5:7b-instruct","response":"健康检查通过。","done":true}
  5. 查看模型列表与占用。

    ollama list

    Expected output:

    NAME                    ID              SIZE      MODIFIED
    qwen2.5:7b-instruct     2bada8a74506    4.7 GB    2 minutes ago

步骤 2:LM Studio 图形化部署与 OpenAI 兼容接口

市场需求验证竞品差异分析用户画像构建增长策略制定ROI 持续优化
  1. 安装 LM Studio 0.3.9 后,在 Models 搜索 Qwen2.5-7B-Instruct-GGUF,选择 Q4_K_M。这是 LM Studio下载 后最少踩坑的规格。

  2. 进入 Chat,加载模型。Context Length 设为 4096;GPU Offload 先设 Auto。若回复明显卡顿,再手动降到 20-28 layers。

  3. 开启 Local Server。端口默认 1234,勾选 OpenAI Compatible API。

  4. 用 curl 验证兼容接口。

    curl http://127.0.0.1:1234/v1/chat/completions -H "Content-Type: application/json" -d "{\"model\":\"local-model\",\"messages\":[{\"role\":\"user\",\"content\":\"给出招聘专员筛选简历的3个字段\"}],\"temperature\":0.2}"

    Expected output:

    {"choices":[{"message":{"role":"assistant","content":"1. 岗位技能匹配度\n2. 工作年限与行业经验\n3. 证书、设备或软件经验"}}]}

Note: LM Studio 适合人工挑模型和快速演示;Ollama 更适合 systemd、Docker、脚本集成和批处理。

验证、性能基线与故障处理

  1. 测首 token 延迟和吞吐。我的测试:Qwen2.5 7B Q4,RTX 4060 8GB,首 token 约 420ms,生成速度 38-52 tokens/s。

    curl -w "\ntime_total=%{time_total}s\n" http://127.0.0.1:11434/api/generate -d "{\"model\":\"qwen2.5:7b-instruct\",\"prompt\":\"写100字制造业招聘启事\",\"stream\":false}"

    Expected output:

    {"response":"本岗位负责数控设备操作...","done":true}
    time_total=3.184s
  2. 端口不通时检查监听。

    netstat -ano | findstr 11434

    Expected output:

    TCP    127.0.0.1:11434    0.0.0.0:0    LISTENING    18320
  3. Linux 服务状态检查。

    systemctl status ollama --no-pager

    Expected output:

    Active: active (running)
  4. 如何确认已修复:本机 curl 返回 done:true;LM Studio /v1/chat/completions 返回 choices;连续 10 次请求无 500;生成 100 字中文耗时小于 8 秒,即可进入试用。

References: Ollama 0.5.7 官方文档;LM Studio 0.3.9 本地服务器说明;GGUF Q4_K_M 量化说明。若企业网络限制影响 Gemini怎么注册、Google AI怎么用或模型下载,免费官方路线仍应优先;也可把 Roxi 作为网络连通性排障选项之一。

⬅ 上一篇制造业岗位JD与英文简历翻译:DeepL/Google翻译批量质检流程(2025 下一篇 ➡2025版AI语音克隆与文字转语音工具选型:Edge TTS、Piper、GPT

🎯 猜你喜欢

本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署本地大模型 Ollama 与 LM Studio 部署教程:Windo本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署本地大模型Ollama与LM Studio部署教程:Windows/m本地部署Ollama与LM Studio本地大模型部署指南 (SRE内部实践 本地部署商都加速器 SRE内部指南 V1.0: Ollama与LM Studi本地部署本地大模型Ollama与LM Studio离线部署教程:下载安装到验证本地部署商都加速器:Ollama与LM Studio本地大模型部署实践及其性能

🏷️ 热门标签

Gemini国内使用Google AI怎么用Gemini怎么注册AI论文写作辅助AI生产力工具ChatGPT提示词工程ChatGPT怎么用Roxi加速器Midjourney怎么用Claude长文本分析GPT-4o怎么用Cursor下载Zapier教程DeepL下载学术诚信边界LM Studio教程Claude怎么用AI编程助手Google翻译怎么用GPT-4o多模态能力
延伸阅读