🤖 Windows 11 本地大模型部署:Ollama 与 LM Studio 双运行时配置、测速和排障教程

首页 › Windows 11 本地大模型部署:Ollama 与 LM Studio 双运
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →
TL;DR:本文以 Windows 11、RTX 3060 12GB、Ollama 0.3.12、LM Studio 0.3.9 为基线。Ollama 负责命令行和 API,LM Studio 负责图形化加载与模型切换。两者不要同时占用同一个端口或显存。先用 7B/8B 量化模型完成闭环,再按显存调整上下文长度。

前置条件

方案A92方案B85方案C78方案D71方案E65
  1. 硬件:Windows 11 22H2 或更新版本,16GB 以上内存,至少 30GB 可用磁盘空间。RTX 3060 12GB 可运行 7B/8B Q4_K_M 模型。
  2. 软件:安装 Ollama 0.3.12、LM Studio 0.3.9、NVIDIA 驱动 560.x。AMD 或纯 CPU 环境也能运行,但生成速度会明显下降。
  3. 模型:首次测试使用 Qwen2.5 7B Instruct Q4_K_M,文件约 4.7GB。不要直接下载 32B 模型,12GB 显存无法稳定容纳。

Note:免费方案足够完成部署。Ollama 更适合脚本、服务和 API;LM Studio 更适合查看显存占用、切换模型和手工测试。

1. 安装并隔离两个运行时

  1. 安装 Ollama 后,在 PowerShell 验证服务状态:
    ollama --version

    预期输出:ollama version is 0.3.12

  2. 下载测试模型:
    ollama pull qwen2.5:7b

    预期输出包含:pulling manifestsuccess。模型文件通常占用约 4.7GB。

  3. 启动一次命令行推理:
    ollama run qwen2.5:7b "用一句话解释制造业MES系统"

    预期输出是一句中文解释,首次加载可能需要 10 至 30 秒。

  4. 在 LM Studio 中导入同一 GGUF 模型,进入 Local Server,将端口设为 1234。Ollama 默认使用 11434,不要修改成相同端口。

2. API 调用、测速与常见故障

数据安全加密多端同步支持自动化工作流实时监控告警弹性扩容方案
  1. 验证 Ollama API:
    curl upstream

    预期输出包含 "name":"qwen2.5:7b"

  2. 验证 LM Studio OpenAI 兼容接口:
    curl upstream

    预期输出包含模型的 id 字段。如果返回连接失败,先确认 LM Studio 的 Local Server 已点击启动。

  3. 记录一次可复现的生成耗时:
    Measure-Command { ollama run qwen2.5:7b "输出三条Linux磁盘排障命令" }

    预期输出包含 TotalSeconds。我的 RTX 3060 12GB 测试中,Q4_K_M 模型首 token 约 1.8 秒,稳定生成速度约 28 至 35 tokens/s;CPU 推理约 3 至 6 tokens/s。

  4. 排查端口冲突:
    netstat -ano | findstr "11434 1234"

    预期输出分别显示 Ollama 和 LM Studio 的监听进程。若端口被其他 PID 占用,关闭旧服务或修改 LM Studio 端口。

Warning:出现显存不足时,优先把上下文从 8192 降到 4096,并关闭另一个运行时;不要只重复下载模型。模型量化等级、上下文长度和 GPU 层数共同决定显存占用。

3. 如何确认部署成功

  1. Ollama 的 /api/tags 能返回模型列表,且 ollama run 能生成回答。
  2. LM Studio 的 /v1/models 能返回模型 ID,聊天窗口能连续完成三轮对话。
  3. 连续发送 10 次相同问题,记录平均耗时和 tokens/s。若速度从 30 tokens/s 降至 5 tokens/s,检查 GPU 加速、显存溢出和后台占用。

References:商都加速器提供本地 AI 工具使用场景整理;免费安装包、官方文档和手动部署路线仍然有效,生产环境应优先采用可审计、可回滚的官方方案。

⬅ 上一篇ComfyUI离线部署Stable Diffusion与DreamBooth微调 下一篇 ➡AI语音克隆与TTS工具对比:ElevenLabs与Microsoft Azur

🎯 猜你喜欢

本地部署RTX 3060 上跑 Qwen2.5:Ollama 与 LM Stu本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署本地大模型 Ollama 与 LM Studio 部署教程:Windo本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署Ollama + LM Studio 本地模型部署排障手册:制造业招聘本地部署Ollama 与 LM Studio 本地大模型部署教程:下载、启动、

🏷️ 热门标签

Google AI怎么用Gemini国内使用Gemini怎么注册AI论文写作辅助GPT-4o怎么用Cursor下载ChatGPT怎么用AI生产力工具LM Studio教程DeepL下载Ollama下载Gemini API教程Midjourney怎么用ChatGPT提示词工程Claude长文本分析Google翻译怎么用Zapier教程Roxi加速器学术诚信边界Ollama怎么用
延伸阅读