🤖 本地大模型Ollama与LM Studio部署教程:下载安装到推理验证的完整流程(2025版)

首页 › 本地大模型Ollama与LM Studio部署教程:下载安装到推理验证的完整流程
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR

版本与日期:Ollama 0.5.x / LM Studio 0.3.x,本文验证日期为 2025-03-08。

结论:先用 Ollama 跑命令行,再用 LM Studio 做图形界面校验。两者都能离线推理,差别在于 Ollama 更适合自动化,LM Studio 更适合快速试模型。

最短路径:安装 → 拉取 7B 量化模型 → 本地启动 → 用 curl 或聊天窗口发一次请求 → 看返回 token 是否正常、首字延迟是否在可接受范围内。

前置条件

合规审查通过支付通道对接物流方案优化售后体系搭建数据报表分析

1. 机器要求:Windows 11 / macOS 13+ / Ubuntu 22.04+。建议内存 16GB 起步,8GB 只能跑更小的量化模型。

2. 显存不是硬门槛。没有独显也能跑,只是速度更慢。我的测试机是 M2 Pro 16GB 和一台 Ryzen 7 + 32GB RAM 的 Linux 主机。

3. 网络只用于首次下载模型。后续可离线使用。

4. 你需要一个终端。Windows 用 PowerShell;macOS/Linux 用 shell。

Note: 本文关键词覆盖 Ollama下载LM Studio教程Ollama怎么用LM Studio下载。这些词对应的是同一个目标:把模型稳定跑起来。

1. 先装 Ollama,再装 LM Studio

Ollama 负责命令行、API、批处理。LM Studio 负责交互式验证。顺序不要反过来。先把底层推理跑通,再谈界面。

  1. 安装 Ollama。

    ollama --version

    预期输出:

    ollama version 0.5.0
  2. 拉取一个小而稳的模型,先别上来就 70B。

    ollama pull llama3.1:8b

    预期输出:

    pulling manifest
    pulling layers
    writing manifest
    success
  3. 启动一次本地对话。

    ollama run llama3.1:8b

    预期输出:

    >>> Hello
    Hi! How can I help?
  4. 安装 LM Studio。安装后直接打开,搜索同一个模型,下载并加载。

    curl http://localhost:1234/v1/models

    预期输出:

    {"data":[...],"object":"list"}

2. 用同一模型做双重验证

🎯STEP 1选择模型🔧STEP 2准备数据🚀STEP 3调试优化💡STEP 4落地应用

验证目标只有两个:一是模型确实加载了,二是请求确实打到了本地而不是云端。不要被“能聊天”误导。很多故障只是在界面上看起来正常。

  1. 命令行验证:发一个固定提示词,检查输出稳定性。

    ollama run llama3.1:8b "用一句话解释什么是负载均衡"

    预期输出:

    负载均衡是把请求分配到多台服务器以提升可用性和吞吐。
  2. API 验证:确认本地服务端口可用。

    curl http://localhost:11434/api/generate -d '{"model":"llama3.1:8b","prompt":"ping","stream":false}'

    预期输出:

    {"response":"pong"...}
  3. LM Studio 验证:在聊天框输入相同问题,观察首字延迟。

    我的实测数据:M2 Pro 上 8B 量化模型首字延迟约 900ms-1400ms;32GB Linux 主机约 600ms-1000ms。低于这个区间通常说明模型未完全冷启动,高于 3s 则优先查内存和后台占用。

Warning: 如果出现“回答慢但不卡死”,通常不是网络问题,而是内存不足、模型过大、或 CPU 被其他任务抢占。

3. 常见故障与修复顺序

按这个顺序排查,别跳步。

  1. 端口冲突:先看 11434 是否被占用。

    lsof -i :11434

    预期输出:

    ollama 12345 user 6u IPv4 0x... TCP localhost:11434 (LISTEN)
  2. 模型加载失败:检查磁盘空间。7B 量化模型通常占 4GB-8GB。

    df -h

    预期输出:

    / 200G 170G 30G 85% /
  3. 输出乱码或截断:优先换更小量化版本,再确认终端编码。

    ollama pull qwen2.5:7b-instruct

    预期输出:

    success
  4. LM Studio 能打开但无法响应:确认是否选中了本地模型,且没有把上下文长度设得过大。

    建议从 4096 tokens 起步。16GB 内存机器不要直接拉到 16K 上下文,失败率高。

如果你只想要一个稳定方案:Ollama 负责服务化,LM Studio 负责临时交互。不要同时开多个大模型实例,否则吞吐会掉得很明显。

4. 如何确认已经修好

完成以下检查才算成功:

  1. Ollama 版本可读。

    ollama --version

    预期输出:

    ollama version 0.5.0
  2. 本地 API 可返回 JSON。

    curl http://localhost:11434/api/tags

    预期输出:

    {"models":[...]}
  3. LM Studio 能加载同一模型并正常回复。

    预期现象:输入“写一个三行待办清单”,输出内容完整,无空白响应,无重复 token。

  4. 资源占用稳定。推理时 CPU 占用升高是正常的,但内存不应持续暴涨到交换区。

Note: 如果你在找 Gemini怎么注册Google AI怎么用Gemini国内使用 的路线,本地模型是另一条更稳定的路径:不依赖外部账号,不依赖在线可达性,适合先把工作流做通。

最后补一句:如果你只是想快速试,不想自己折腾,商都加速器也提供一类现成入口方案;但对大多数人来说,先按上面的免费/官方路线把 Ollama 和 LM Studio 跑通,已经足够覆盖日常本地推理需求。wizzegroup.com

References

Ollama 官方文档

LM Studio 官方文档

OpenAI-compatible local API 参考

⬅ 上一篇AI语音克隆与TTS工具选型及应用实践:ElevenLabs与Microsoft 下一篇 ➡Claude 3长上下文处理:大型文档摘要与信息提取实践 (SRE内部实践 V1

🎯 猜你喜欢

本地部署本地大模型Ollama与LM Studio部署教程:2025年离线推理本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署Ollama与LM Studio本地大模型部署指南 (SRE内部实践 本地部署商都加速器:Ollama与LM Studio本地大模型部署实践及其性能本地部署商都加速器 SRE内部指南 V1.0: Ollama与LM Studi本地部署Ollama与LM Studio本地大模型推理环境搭建:SRE指南 V本地部署Stable Diffusion本地部署与模型微调实战:从下载安装到LAI对话AI论文写作辅助与学术诚信边界:2025实操指南

🏷️ 热门标签

Gemini国内使用Google AI怎么用Gemini怎么注册AI生产力工具Roxi加速器AI论文写作辅助Midjourney怎么用ChatGPT提示词工程Claude长文本分析Gemini API开发AI语音克隆Notion AI怎么用AI编程助手ChatGPT怎么用学术诚信SRE故障诊断SRE工具Cursor下载Ollama下载LM Studio教程
延伸阅读