5 分钟搭本地大模型界面——Ollama + Open WebUI + Qwen 是 2026 年国内最稳的本地 AI 工作台方案。Qwen 跑在本地、数据不出公司、API 无限用;Open WebUI 给它一个接近 ChatGPT 的 Web 界面。下面按”为什么选 Ollama + Open WebUI → 怎么搭 → 接 Qwen/DeepSeek → 性能调优”讲清楚。
我自己 4 核 8G VPS 上跑了 Qwen2.5:7B 半年,Q&A、写代码草稿、翻译都在本地完成。完全不依赖任何云服务,模型文件就 4-5 GB,下载一次永久用。

为什么选 Ollama + Open WebUI
两个工具组合是国内跑本地大模型的事实标准:
- Ollama:本地 LLM 推理引擎,Ollama 公司出品(已获大额融资),Mac/Linux 全平台,
ollama pull qwen2.5:7b一行下载 - Open WebUI:原名 Ollama WebUI,Ollama 官方配套 Web 前端,多用户、权限、模型管理、文档 RAG、Web 搜索、插件齐全
组合优势:本地运行、数据不出公司、模型自己选、API 无限次(不按 token 收费)。劣势:硬件要求比 ChatGPT 高(4 核 8G 起步)、需要自己维护、模型效果比 GPT-4 弱一档。
部署前准备
- VPS:4 核 8G 起步(推荐 萤光云日本 VPS 或美西,国内访问日本最快)
- 存储:每个模型 4-8 GB,30 GB 系统盘够装 3-4 个模型
内存是硬指标,CPU 也能跑(慢一些)。Ollama 没用 GPU 也行,跑 CPU 模式只是首 token 慢 5-15 秒。

Ollama 完整部署流程
- SSH 到 VPS(4 核 8G 推荐)
- 装 Ollama:
curl -fsSL https://ollama.com/install.sh | sh - 下载模型:
ollama pull qwen2.5:7b(4.7 GB,5-15 分钟) - 测试:
ollama run qwen2.5:7b "你好" - Ollama 默认监听 11434 端口,提供 OpenAI 兼容 API
Open WebUI 完整部署
- Docker 部署:
docker run -d --name open-webui -p 3000:8080 -e OLLAMA_BASE_URL=http://your-vps-ip:11434 -v open-webui-data:/app/backend/data ghcr.io/open-webui/open-webui:main - 浏览器访问
http://your-vps-ip:3000,注册 admin - Open WebUI 自动检测 Ollama,模型列表显示已下载的 Qwen2.5:7b
- 开始聊天
整个流程 30 分钟内完成。
接 DeepSeek 或其他模型
Ollama 默认接 Qwen/DeepSeek 等开源模型。下载其他模型:
- DeepSeek-R1 7B:
ollama pull deepseek-r1:7b(推理强) - Qwen2.5-Coder 7B:
ollama pull qwen2.5-coder:7b(代码) - Llama 3.1 8B:
ollama pull llama3.1:8b(英文) - 通义千问 Qwen3:
ollama pull qwen3:8b(Qwen 最新)
Open WebUI 自动列出已下载的模型,聊天界面顶部切换即可。
性能调优技巧
- 量化等级:
qwen2.5:7b-q4_K_M(4-bit 量化,模型减半,4 GB,CPU 也能跑) - 上下文长度:
num_ctx 4096限制上下文,省内存 - 多模型并行:Ollama 支持同时跑多个模型,按需切换
- 远程访问:用 Tailscale / Cloudflare Tunnel 远程访问家里的 Ollama
常见问题 FAQ
Q1:Ollama + Open WebUI 跑 4 核 8G 够吗?
7B 量化模型勉强能跑(首 token 5-15 秒)。8 核 16G 体验顺滑。32B 起步要 32G 内存 + 128 GB 内存,VPS 不行,得专用物理机。
Q2:Ollama 和 LM Studio 选哪个?
桌面端 LM Studio 更简单(图形化),VPS/服务器端 Ollama 更好(命令行 + Docker 集成 + API)。
Q3:本地跑大模型和 OpenAI API 比效果差多少?
Qwen2.5-Max / DeepSeek-V3 已经接近 GPT-4 水平(中文场景甚至超过)。7B 量化模型差 1-2 档,但 90% 日常问答够用。
Q4:Ollama 支持多用户吗?
支持,Open WebUI 有多用户、权限、模型访问控制。家庭/团队/工作室都能用。
Q5:本地大模型能跑代码/翻译/写邮件吗?
能。Qwen2.5-Coder 7B 跑代码、Qwen2.5:14B 跑翻译/邮件草稿,效果都很好。Open WebUI 还支持文档上传 RAG。
总结
Ollama + Open WebUI + Qwen/DeepSeek 是 2026 年国内最稳的本地大模型工作台——30 分钟搭起来,模型自己管、数据不出公司、API 无限用。配置关键:4 核 8G VPS 起步,ollama pull qwen2.5:7b 跑日常问答,要更好体验升 Qwen2.5:14B 或 32B。
如果刚开始本地跑大模型,从”萤光云日本 4 核 8G + Ollama + Qwen2.5:7B + Open WebUI”这个最小组合入手——月成本 ¥150 出头,Q&A 写代码草稿翻译都搞定。
需要海外 VPS?萤光云日本 VPS 4 核 8G 体验型 ¥150/月起,国内访问快;美西 VPS 4 核 8G 体验型 ¥150/月起。







