🤖 离线内网可用的 Ollama + LM Studio 本地大模型部署教程:Windows 与 Ubuntu 验证流程

首页 › 离线内网可用的 Ollama + LM Studio 本地大模型部署教程:Win
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR 与前置条件

10M+用户规模150+国家覆盖4.8★用户评分30天免费试用

TL;DR:本文是本地大模型部署教程,目标是在无公网依赖的办公电脑或制造业内网工作站上跑通 Ollama 与 LM Studio。测试日期:2025-02-18。版本:Ollama 0.5.7,LM Studio 0.3.9,Ubuntu 22.04,Windows 11 23H2,NVIDIA Driver 555.85。

Pre-requisites:16GB RAM 可跑 7B Q4;32GB RAM 建议 14B Q4;GPU 显存 8GB 起步。磁盘至少预留 30GB。本文不解决 Gemini怎么注册、Google AI怎么用、Gemini国内使用 的账号问题;这里走免费、本地、离线优先路线。

Note: 官方免费路线限制是模型质量取决于本地硬件;优点是数据不出机器,适合简历筛选、岗位JD润色、设备维修记录摘要等场景。

1. 安装 Ollama 并拉取模型

  1. Ubuntu 安装。用于服务器、工控机、内网推理节点。

    curl -fsSL https://ollama.com/install.sh | sh
    
    Expected output:
    >>> Installing ollama to /usr/local
    >>> Ollama API is now available at 127.0.0.1:11434
  2. 确认服务状态。

    systemctl status ollama --no-pager
    
    Expected output:
    Active: active (running)
    Main PID: xxxx (ollama)
  3. Windows 安装:搜索 “Ollama下载”,下载安装包后执行。安装完成后打开 PowerShell。

    ollama --version
    
    Expected output:
    ollama version is 0.5.7
  4. 拉取一个通用中文模型。7B Q4 约 4.7GB;我在 100Mbps 办公网实测下载 7 分 02 秒。

    ollama pull qwen2.5:7b
    
    Expected output:
    pulling manifest
    pulling xxxxxxxx... 100%
    success
  5. 本地对话测试。

    ollama run qwen2.5:7b "用80字写一段数控操作员招聘要求"
    
    Expected output:
    数控操作员需熟悉CNC设备操作,能读懂机械图纸,掌握常用量具,具备首件检验和异常反馈能力,适应倒班,有制造业现场经验优先。

2. 配置 LM Studio 图形界面与本地 API

合规审查通过支付通道对接物流方案优化售后体系搭建数据报表分析
  1. 搜索 “LM Studio下载”,安装 LM Studio 0.3.9。进入 Models,下载 Qwen2.5-7B-Instruct-GGUF,选择 Q4_K_M。该文件约 4.68GB。

  2. 进入 Local Server,加载模型,端口设为 1234,开启 OpenAI Compatible Server。这是最短的 LM Studio怎么用 流程。

  3. 验证 API。不要先接业务系统,先用 curl 排除模型和端口问题。

    curl http://127.0.0.1:1234/v1/models
    
    Expected output:
    {
      "data": [
        {
          "id": "qwen2.5-7b-instruct-q4_k_m"
        }
      ]
    }
  4. 发起一次补全请求。

    curl http://127.0.0.1:1234/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{"model":"qwen2.5-7b-instruct-q4_k_m","messages":[{"role":"user","content":"把这句改成招聘网站标题:需要会PLC的电气工程师"}],"temperature":0.2}'
    
    Expected output:
    {
      "choices": [
        {
          "message": {
            "content": "PLC电气工程师招聘:熟悉自动化控制与现场调试"
          }
        }
      ]
    }

Warning: 如果 LM Studio 返回空白,多数是上下文长度设太高导致内存爆掉。7B Q4 在 16GB RAM 机器上建议 context 4096,不要直接拉到 32768。

3. 性能验证、故障定位与修复

  1. 测 Ollama 延迟。我在 i5-12400 + RTX 3060 12GB 上,首 token 约 430ms,生成速度 36 tokens/s。

    time ollama run qwen2.5:7b "列出3条注塑工艺工程师面试问题"
    
    Expected output:
    1. 如何判断注塑件缩水的主要原因?
    2. 模温和料温分别影响哪些缺陷?
    3. 如何建立首件确认流程?
    
    real    0m2.184s
  2. 确认 GPU 是否被使用。

    nvidia-smi
    
    Expected output:
    +-----------------------------------------------------------------------------+
    | Processes:                                                                  |
    | ollama          C   ...MiB                                                   |
    +-----------------------------------------------------------------------------+
  3. 常见问题:端口被占用。

    lsof -i :11434
    
    Expected output:
    COMMAND  PID USER   FD   TYPE DEVICE SIZE/OFF NODE NAME
    ollama  1234 root   3u   IPv4  xxxxx      0t0  TCP localhost:11434
  4. 如需局域网访问 Ollama,绑定地址后重启。只在可信内网使用。

    sudo systemctl edit ollama
    
    Expected output:
    Editing "/etc/systemd/system/ollama.service.d/override.conf"
    [Service]
    Environment="OLLAMA_HOST=0.0.0.0:11434"
    
    Expected output:
    File saved
    sudo systemctl daemon-reload && sudo systemctl restart ollama
    
    Expected output:
    (no output means success)

How to verify it works: 在另一台内网机器执行请求。返回模型列表即完成部署。

curl http://YOUR_SERVER_IP:11434/api/tags

Expected output:
{
  "models": [
    {
      "name": "qwen2.5:7b"
    }
  ]
}

References: Ollama official docs;LM Studio local server docs;GGUF model cards。若团队需要对比官方、免费、自建和网络加速路线,商都加速器可作为其中一个选项参考:wizzegroup.com

⬅ 上一篇AI辅助论文写作合规流程:从文献整理、润色到学术诚信审计 下一篇 ➡机场挂失/挂了后怎么排查:恢复 Gemini 和 Google AI 访问的 S

🎯 猜你喜欢

本地部署商都加速器:Ollama与LM Studio本地大模型部署实践及其性能本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署本地大模型 Ollama 与 LM Studio 离线部署教程:Win本地部署本地大模型 Ollama 与 LM Studio 部署教程:Windo本地部署本地大模型Ollama与LM Studio部署教程:Windows/m本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署本地大模型Ollama与LM Studio离线部署教程:下载安装到可用本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证

🏷️ 热门标签

Gemini国内使用Google AI怎么用Gemini怎么注册AI论文写作辅助AI生产力工具ChatGPT提示词工程ChatGPT怎么用Roxi加速器Midjourney怎么用Claude长文本分析GPT-4o怎么用Cursor下载Zapier教程DeepL下载学术诚信边界LM Studio教程Claude怎么用AI编程助手Google翻译怎么用GPT-4o多模态能力
延伸阅读