属于大家的
VPS知识分享站

Ollama + Open WebUI + Qwen/DeepSeek 国内模型一键部署:本地大模型工作台(2026)

5 分钟搭本地大模型界面——Ollama + Open WebUI + Qwen 是 2026 年国内最稳的本地 AI 工作台方案。Qwen 跑在本地、数据不出公司、API 无限用;Open WebUI 给它一个接近 ChatGPT 的 Web 界面。下面按”为什么选 Ollama + Open WebUI → 怎么搭 → 接 Qwen/DeepSeek → 性能调优”讲清楚。

我自己 4 核 8G VPS 上跑了 Qwen2.5:7B 半年,Q&A、写代码草稿、翻译都在本地完成。完全不依赖任何云服务,模型文件就 4-5 GB,下载一次永久用。

Ollama+Open WebUI组合示意图
Ollama+Open WebUI是国内跑本地大模型的事实标准——30分钟搭起来。

为什么选 Ollama + Open WebUI

两个工具组合是国内跑本地大模型的事实标准:

  • Ollama:本地 LLM 推理引擎,Ollama 公司出品(已获大额融资),Mac/Linux 全平台,ollama pull qwen2.5:7b 一行下载
  • Open WebUI:原名 Ollama WebUI,Ollama 官方配套 Web 前端,多用户、权限、模型管理、文档 RAG、Web 搜索、插件齐全

组合优势:本地运行、数据不出公司、模型自己选、API 无限次(不按 token 收费)。劣势:硬件要求比 ChatGPT 高(4 核 8G 起步)、需要自己维护、模型效果比 GPT-4 弱一档。

部署前准备

  • VPS:4 核 8G 起步(推荐 萤光云日本 VPS 或美西,国内访问日本最快)
  • 存储:每个模型 4-8 GB,30 GB 系统盘够装 3-4 个模型

内存是硬指标,CPU 也能跑(慢一些)。Ollama 没用 GPU 也行,跑 CPU 模式只是首 token 慢 5-15 秒。

Ollama部署流程示意图:安装→拉模型→启动Open WebUI
5 步搭起来:装 Ollama → 拉 Qwen 模型 → 启动 Open WebUI → 浏览器聊天。

Ollama 完整部署流程

  1. SSH 到 VPS(4 核 8G 推荐)
  2. 装 Ollama:curl -fsSL https://ollama.com/install.sh | sh
  3. 下载模型:ollama pull qwen2.5:7b(4.7 GB,5-15 分钟)
  4. 测试:ollama run qwen2.5:7b "你好"
  5. Ollama 默认监听 11434 端口,提供 OpenAI 兼容 API

Open WebUI 完整部署

  1. Docker 部署:docker run -d --name open-webui -p 3000:8080 -e OLLAMA_BASE_URL=http://your-vps-ip:11434 -v open-webui-data:/app/backend/data ghcr.io/open-webui/open-webui:main
  2. 浏览器访问 http://your-vps-ip:3000,注册 admin
  3. Open WebUI 自动检测 Ollama,模型列表显示已下载的 Qwen2.5:7b
  4. 开始聊天

整个流程 30 分钟内完成。

接 DeepSeek 或其他模型

Ollama 默认接 Qwen/DeepSeek 等开源模型。下载其他模型:

  • DeepSeek-R1 7B:ollama pull deepseek-r1:7b(推理强)
  • Qwen2.5-Coder 7B:ollama pull qwen2.5-coder:7b(代码)
  • Llama 3.1 8B:ollama pull llama3.1:8b(英文)
  • 通义千问 Qwen3:ollama pull qwen3:8b(Qwen 最新)

Open WebUI 自动列出已下载的模型,聊天界面顶部切换即可。

性能调优技巧

  • 量化等级qwen2.5:7b-q4_K_M(4-bit 量化,模型减半,4 GB,CPU 也能跑)
  • 上下文长度num_ctx 4096 限制上下文,省内存
  • 多模型并行:Ollama 支持同时跑多个模型,按需切换
  • 远程访问:用 Tailscale / Cloudflare Tunnel 远程访问家里的 Ollama

常见问题 FAQ

Q1:Ollama + Open WebUI 跑 4 核 8G 够吗?

7B 量化模型勉强能跑(首 token 5-15 秒)。8 核 16G 体验顺滑。32B 起步要 32G 内存 + 128 GB 内存,VPS 不行,得专用物理机。

Q2:Ollama 和 LM Studio 选哪个?

桌面端 LM Studio 更简单(图形化),VPS/服务器端 Ollama 更好(命令行 + Docker 集成 + API)。

Q3:本地跑大模型和 OpenAI API 比效果差多少?

Qwen2.5-Max / DeepSeek-V3 已经接近 GPT-4 水平(中文场景甚至超过)。7B 量化模型差 1-2 档,但 90% 日常问答够用。

Q4:Ollama 支持多用户吗?

支持,Open WebUI 有多用户、权限、模型访问控制。家庭/团队/工作室都能用。

Q5:本地大模型能跑代码/翻译/写邮件吗?

能。Qwen2.5-Coder 7B 跑代码、Qwen2.5:14B 跑翻译/邮件草稿,效果都很好。Open WebUI 还支持文档上传 RAG。

总结

Ollama + Open WebUI + Qwen/DeepSeek 是 2026 年国内最稳的本地大模型工作台——30 分钟搭起来,模型自己管、数据不出公司、API 无限用。配置关键:4 核 8G VPS 起步,ollama pull qwen2.5:7b 跑日常问答,要更好体验升 Qwen2.5:14B 或 32B。

如果刚开始本地跑大模型,从”萤光云日本 4 核 8G + Ollama + Qwen2.5:7B + Open WebUI”这个最小组合入手——月成本 ¥150 出头,Q&A 写代码草稿翻译都搞定。

需要海外 VPS?萤光云日本 VPS 4 核 8G 体验型 ¥150/月起,国内访问快;美西 VPS 4 核 8G 体验型 ¥150/月起。

相关推荐

赞(0)
未经允许不得转载:VPS知识分享站 » Ollama + Open WebUI + Qwen/DeepSeek 国内模型一键部署:本地大模型工作台(2026)