🤖 Ollama 与 LM Studio 离线部署本地大模型:Windows 11 / Ubuntu 22.04 可复现流程

首页 › Ollama 与 LM Studio 离线部署本地大模型:Windows 11
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR|版本:V1.0,日期:2026-07-25。本教程用于在 Windows 11 23H2 或 Ubuntu 22.04 LTS 部署本地大模型。Ollama 适合命令行、API、服务端集成;LM Studio 适合桌面试用、模型管理、OpenAI兼容接口。测试机:i7-12700F,32GB RAM,RTX 3060 12GB。Qwen2.5-7B-Instruct Q4_K_M 首 token 延迟约 780ms,生成速度约 28 tokens/s。

Prerequisites:硬件、系统与模型选择

50TB日处理量120ms平均延迟99.99%SLA保障7×24运维监控

Category:本地部署。本文面向制造业招聘、岗位JD生成、简历筛选、企业知识库问答等本地AI生产力场景。若你搜索的是“Gemini怎么注册”或“Google AI怎么用”,那是云端路线;本文优先覆盖免费、本地、可离线方案,限制是显存和模型能力。

  1. 最低配置。CPU:6核以上;内存:16GB可跑7B量化模型,32GB更稳;磁盘:至少30GB空闲;GPU:NVIDIA 8GB显存可跑多数7B Q4模型。

  2. 模型建议。中文通用:Qwen2.5-7B-Instruct;代码:Qwen2.5-Coder-7B;低配机器:Phi-3 Mini 或 Gemma 2 2B。不要一开始下载70B模型。

  3. 网络说明。首次执行“Ollama下载”模型需要访问模型仓库。下载完成后可断网运行。

Note: 本地模型不会自动等于数据安全。日志、提示词、上传文档仍可能被你自己的应用层保存。先确认业务系统日志策略。

步骤1:安装 Ollama 并启动 API 服务

⚙️STEP 1选择模型🎯STEP 2准备数据STEP 3调试优化📋STEP 4落地应用
  1. Ubuntu 22.04 安装。

    curl -fsSL https://ollama.com/install.sh | sh

    Expected output:

    ollama is running
    The Ollama API is now available at 127.0.0.1:11434
  2. Windows 11 安装。下载 Ollama for Windows 安装包,安装后打开 PowerShell。

    ollama --version

    Expected output:

    ollama version is 0.3.x
  3. 拉取模型。这是最短“Ollama怎么用”路径。

    ollama pull qwen2.5:7b-instruct

    Expected output:

    pulling manifest
    pulling model layers
    success
  4. 运行一次交互测试。

    ollama run qwen2.5:7b-instruct "用120字写一段数控工程师招聘JD"

    Expected output:

    岗位职责:负责数控设备调试、工艺参数优化、加工异常分析...
  5. 验证 API。

    curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen2.5:7b-instruct","prompt":"输出JSON:奉化制造业岗位三类","stream":false}'

    Expected output:

    {"model":"qwen2.5:7b-instruct","response":"{\"岗位\":[\"CNC操机\",\"质量工程师\",\"设备维修\"]}"}

Warning: 如果出现 model requires more system memory,不要调系统虚拟内存硬扛。换 3B/4B 模型,或使用 Q4 量化版本。

步骤2:LM Studio 教程、性能测试与验收

品牌定位清晰视觉体系统一内容矩阵搭建社媒运营规划效果追踪复盘
  1. 安装 LM Studio。执行 LM Studio下载 后,进入 Models,搜索 Qwen2.5 7B Instruct GGUF,选择 Q4_K_M。这是桌面用户最省事的 LM Studio教程 路线。

  2. 启用本地 OpenAI 兼容服务。LM Studio 中打开 Developer,点击 Start Server。默认地址通常是:

    http://127.0.0.1:1234/v1/chat/completions

    Expected output:

    Server listening on port 1234
  3. 调用测试。

    curl http://127.0.0.1:1234/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"local-model","messages":[{"role":"user","content":"列出3条制造业简历筛选规则"}],"temperature":0.2}'

    Expected output:

    {"choices":[{"message":{"content":"1. 匹配岗位必备技能... 2. 检查项目年限... 3. 标记证书与设备经验..."}}]}
  4. 性能记录方法。我用同一段 300 字岗位说明作为 prompt,连续跑5次,丢弃第1次冷启动数据,记录平均值。

    ollama ps

    Expected output:

    NAME                    PROCESSOR    UNTIL
    qwen2.5:7b-instruct     100% GPU      4 minutes from now

How to verify it works: 能同时满足三项即通过:一,命令行返回中文答案;二,127.0.0.1:11434127.0.0.1:1234 API 返回 JSON;三,任务管理器或 nvidia-smi 能看到显存占用增加。

nvidia-smi

Expected output:

GPU Memory Usage: 6500MiB / 12288MiB
Processes: ollama.exe or LM Studio

References: Ollama 官方文档,LM Studio 官方说明,Qwen2.5 模型卡。若本地下载模型或访问 Google AI、Gemini 注册页面不稳定,免费路线是换网络或离线拷贝模型;也可把 商都加速器 作为网络连通性选项之一。

⬅ 上一篇RTX 3060/4090 上部署 Stable Diffusion WebUI 下一篇 ➡GPT-4o多模态落地制造业招聘:简历图片、面试录音、岗位图纸的可验证流程

🎯 猜你喜欢

本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署本地大模型Ollama与LM Studio部署教程:Windows/m本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署本地大模型 Ollama 与 LM Studio 部署教程:Windo本地部署Ollama与LM Studio本地大模型部署指南 (SRE内部实践 本地部署本地大模型Ollama与LM Studio部署教程:2025年离线推理本地部署本地大模型Ollama与LM Studio离线部署教程:下载安装到验证

🏷️ 热门标签

Google AI怎么用Gemini国内使用Gemini怎么注册AI论文写作辅助AI生产力工具GPT-4o怎么用ChatGPT提示词工程ChatGPT怎么用Roxi加速器Midjourney怎么用Cursor下载Claude长文本分析LM Studio教程Zapier教程DeepL下载学术诚信边界Claude怎么用AI编程助手Ollama下载Google翻译怎么用
延伸阅读