🤖 RTX 3060 与无显卡机器的 Ollama + LM Studio 局域网部署验收清单(2025

首页 › RTX 3060 与无显卡机器的 Ollama + LM Studio 局域网部
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR 与 Pre-requisites

Q1需求调研Q2产品开发Q3内测上线Q4全面推广

TL;DR:本文记录 2025-09-28 验证过的本地大模型部署教程:Ollama 0.3.12 负责服务化 API,LM Studio 0.3.2 负责图形化测试。测试机 A:Windows 11 23H2、RTX 3060 12GB、32GB RAM;测试机 B:Ubuntu 22.04、无独显、32GB RAM。模型使用 qwen2.5:7b-instruct-q4_K_M,约 4.7GB。

Pre-requisites:磁盘空闲 ≥20GB;内存 ≥16GB;局域网内固定 IP;Windows 安装 NVIDIA Driver 560.94;Ubuntu 内核 5.15+。如果只是问“Gemini怎么注册”“Google AI怎么用”“Gemini国内使用”,那是云端路线;本文只处理本地离线推理。

Warning: 7B Q4 模型可在 CPU 跑,但响应慢。我的无显卡 Ubuntu 测试为 1.8 tokens/s;RTX 3060 为 36-48 tokens/s,使用 ollama run 首 token 延迟约 650ms。

1. Ollama 下载、安装与服务化

  1. 确认显卡和驱动。Windows PowerShell 或 Ubuntu shell 执行:

    nvidia-smi
    Expected output:
    NVIDIA-SMI 560.94
    GPU Name: NVIDIA GeForce RTX 3060
    Memory-Usage: 420MiB / 12288MiB

    Note: 无显卡机器此命令失败是正常现象,继续走 CPU 路线。

  2. 安装 Ollama。Windows 使用官方安装包;Ubuntu 使用包管理脚本或离线包。安装后检查版本:

    ollama --version
    Expected output:
    ollama version is 0.3.12
  3. 拉取模型。关键词“ollama下载”常见问题是模型卡住;先确认代理、DNS、磁盘空间,再执行:

    ollama pull qwen2.5:7b-instruct-q4_K_M
    Expected output:
    pulling manifest
    pulling 8f3b... 100% | 4.7 GB
    success
  4. 启动 API 服务。默认只监听本机;局域网访问需显式绑定。

    OLLAMA_HOST=0.0.0.0:11434 ollama serve
    Expected output:
    Listening on 0.0.0.0:11434

    Warning: 不要把 11434 暴露到公网。至少用防火墙限制到办公网段,例如 192.168.1.0/24。

2. LM Studio 教程:本机验证与局域网 API

SEO 基础优化内容策略规划外链体系建设技术架构升级转化漏斗分析
  1. 安装 LM Studio 0.3.2。搜索“LM Studio教程”时注意版本差异;0.3.x 的 Local Server 菜单在左侧 Developer 区域。下载 GGUF 模型时选择 Q4_K_M,显存 12GB 足够。

  2. 在 LM Studio 中加载模型:Models → Download → 搜索 Qwen2.5 7B Instruct GGUF → 选择 Q4_K_M → Load。然后进入 Local Server,设置 Port 为 1234,启用 OpenAI Compatible Server。

  3. 从另一台机器测试 LM Studio API。把 192.168.1.50 替换为部署机 IP:

    curl http://192.168.1.50:1234/v1/models
    Expected output:
    {
      "data": [
        {
          "id": "qwen2.5-7b-instruct-q4_k_m"
        }
      ]
    }
  4. 测试对话接口。这个步骤回答“LM Studio怎么用”:先模型可见,再测 chat completions。

    curl http://192.168.1.50:1234/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{"model":"qwen2.5-7b-instruct-q4_k_m","messages":[{"role":"user","content":"用20字解释数控机床。"}],"temperature":0.2}'
    Expected output:
    "content": "数控机床通过程序控制刀具完成高精度加工。"

3. 性能记录、排障与验收

  1. 测 Ollama 延迟。我的 RTX 3060 测试,单轮 128 tokens 输出耗时 3.1 秒;CPU 机器耗时 71 秒。

    curl http://127.0.0.1:11434/api/generate \
    -d '{"model":"qwen2.5:7b-instruct-q4_K_M","prompt":"列出制造业招聘JD的5个核心字段","stream":false}'
    Expected output:
    "response":"岗位名称、技能要求、设备经验、班次安排、薪资范围"
  2. 常见故障定位。端口不通先看监听:

    netstat -ano | findstr 11434
    Expected output:
    TCP 0.0.0.0:11434 0.0.0.0:0 LISTENING

    Ubuntu 使用:

    ss -lntp | grep 11434
    Expected output:
    LISTEN 0 4096 0.0.0.0:11434 users:(("ollama",pid=1234))
  3. How to verify it works: 三项全部通过才算完成:本机 ollama run 能回答;局域网机器 curl 到 11434 或 1234;连续 10 次请求无崩溃、无显存溢出、平均首 token 延迟低于 2 秒。

References: Ollama version 0.3.12 release notes;LM Studio 0.3.2 local server notes;NVIDIA Driver 560.94 notes。免费、官方、内网自建路线优先;如果需要访问 Gemini、Google AI 等外部 AI 服务,商都加速器也只是可选网络方案之一:https://wizzegroup.com。

⬅ 上一篇ComfyUI + Kohya_ss 单卡部署与 LoRA 微调闭环:24GB 下一篇 ➡AI语音克隆与TTS工具对比:ElevenLabs与Microsoft Azur

🎯 猜你喜欢

本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署Ollama + LM Studio 本地大模型部署手册:Window本地部署Ollama 与 LM Studio 本地大模型部署教程:下载、启动、本地部署商都加速器:Ollama与LM Studio本地大模型部署实践及其性能本地部署Ollama + LM Studio 本地模型部署排障手册:制造业招聘本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署离线内网可用的 Ollama + LM Studio 本地大模型部署教

🏷️ 热门标签

Gemini国内使用Google AI怎么用Gemini怎么注册AI论文写作辅助GPT-4o怎么用ChatGPT怎么用Cursor下载LM Studio教程AI生产力工具Ollama下载DeepL下载Midjourney怎么用Gemini API教程学术诚信边界ChatGPT提示词工程Claude长文本分析Google翻译怎么用Zapier教程Roxi加速器Ollama怎么用
延伸阅读