属于大家的
VPS知识分享站

RAGFlow 企业级 RAG 部署:4 核 8G 起 + Chat/Embedding/Rerank 三类模型配置(2026)

RAGFlow 装好默认模型是空的,配置什么模型决定了检索效果——这是 2024 年 RAGFlow 出来后最常被踩的坑。RAGFlow 文档解析业界最强(复杂 PDF/表格/扫描件),但模型配错了检索效果就垮。下面按”配模型 → 配 Embedding → 配 Rerank → 性能调优”讲清楚。

我自己帮 3 个法律/金融团队搭过 RAGFlow——配错模型时 RAG 检索完全不靠谱,配对后文档问答准确率能到 90%+。模型选型是 RAGFlow 效果的天花板。

RAGFlow三类模型示意图:Chat+Embedding+Rerank
RAGFlow需要三类模型:Chat生成答案、Embedding转向量、Rerank重排。

RAGFlow 需要配哪三类模型

RAGFlow 不像 Dify 那样接 LLM 就能用,它需要三类模型协同:

  • Chat 模型(LLM):负责最后生成答案,Qwen2.5 / DeepSeek 都行
  • Embedding 模型:把文档切块转成向量,存进向量数据库
  • Rerank 模型:检索后重排序,挑出最相关的 top-k

三类模型都要配,RAGFlow 才能完整跑通。

部署前准备

  • VPS:RAGFlow 比 Dify 重(深度学习模型吃内存),4 核 8G 起步(萤光云美西 VPS ¥150/月起);企业级数据量大升 8 核 16G + GPU 加速
  • API keys:至少 1 个 LLM key(DeepSeek / Qwen),1 个 Embedding key(推荐 bge-large 或 m3e),可选 Rerank key

国内推荐组合:DeepSeek-V3 做 Chat + BAAI/bge-large-zh-v1.5 做 Embedding + BAAI/bge-reranker-v2-m3 做 Rerank(都能从 HuggingFace 或国内镜像下载)。

RAGFlow配置流程示意图:部署→配模型→上传文档→测试
RAGFlow 5 步上手:部署 + 配模型 + 上传文档 + 训练 + 测试。

Docker Compose 部署

  1. SSH 到 VPS(4 核 8G 起步)
  2. 装 Docker + Docker Compose
  3. 拉 RAGFlow 仓库:git clone https://github.com/infiniflow/ragflow.git
  4. 进入 docker 目录:cd ragflow/docker
  5. 复制环境变量:cp .env.example .env
  6. 设置 HF_ENDPOINT(国内镜像)+ MACOS=0(Linux 部署)
  7. 启动:docker compose up -d
  8. 浏览器访问 80 端口,初始化 admin

注意:RAGFlow 第一次启动会下载 Embedding 模型(bge-large-zh-v1.5,约 1.5 GB),慢一些。

配置 Chat 模型

登录 RAGFlow 后台 → 模型设置 → LLM → 添加:

DeepSeek 配置:

  • 模型类型:OpenAI-API-compatible
  • API base:https://api.deepseek.com/v1
  • API key:你的 DeepSeek key
  • 模型名:deepseek-chat

Qwen 配置:

  • API base:https://dashscope.aliyuncs.com/compatible-mode/v1
  • 模型名:qwen-maxqwen-plus

配置 Embedding 模型

RAGFlow 自带 Embedding 模型列表,国内推荐:

  • bge-large-zh-v1.5:智源开源,中文 RAG 标杆,免费,本地部署
  • m3e:Moka 开源,中文 Embedding
  • Qwen3-Embedding:阿里通义千问新出的 Embedding(API 调用)

本地部署选 bge-large-zh-v1.5,模型文件存到 RAGFlow 服务能访问的目录,配置里指定 model_path 即可。

配置 Rerank 模型

Rerank 是 RAGFlow 检索效果的关键——Embedding 检索出 top 50 候选,Rerank 重排到 top 3-5 给 LLM。推荐:

  • bge-reranker-v2-m3:智源开源,中文 Rerank 强项
  • bge-reranker-large:上一代,效果也很好

同样本地部署,把模型文件路径配到 RAGFlow 即可。

性能调优技巧

  • 文档切块策略:法律/合同用”按章节切”、技术手册用”按代码块切”、财务报表用”按表格切”——RAGFlow 自动识别但你可以手动调
  • 检索参数:top_k 从 50 调到 30、相似度阈值 0.4-0.6,多路召回比单路召回效果好
  • Rerank 必开:不开 Rerank 检索准确率会差 20-30%
  • 模型组合:Qwen2.5-Max 适合中文长文档问答、DeepSeek-R1 适合需要推理的复杂问答

常见问题 FAQ

Q1:RAGFlow 跑 4 核 8G 够吗?

够用,但开 bge-large Embedding 后内存吃紧,建议 4 核 8G + 充足 swap。生产环境升 8 核 16G + GPU 加速。

Q2:RAGFlow 一定要用 Qwen/DeepSeek 吗?

不一定。RAGFlow Chat 模型是 OpenAI 兼容接口,能接 GPT-4 / Claude / Gemini。Embedding 选 bge 系列,Rerank 选 bge-reranker 系列最稳。

Q3:RAGFlow 文档解析比 Dify 强在哪?

复杂 PDF(扫描件、表格、公式、多栏)RAGFlow 解析业界最强。Dify 用普通 OCR + 文本切片,RAGFlow 用 DeepDOC + 多路召回,文档问答准确率能高 15-20%。

Q4:RAGFlow vs Dify 怎么选?

文档复杂(金融/法律/技术)选 RAGFlow,应用搭建(多模型切换 + 工作流)选 Dify。两者常组合用:RAGFlow 做文档解析,Dify 做应用前端。

Q5:RAGFlow 跑 100 GB 文档需要多大配置?

4 核 8G + 200GB SSD 起步。文档越多 Embedding 计算时间越长,初次入库 100 GB 大约 8-12 小时。生产环境建议 8 核 16G + SSD + 数据库分离。

总结

RAGFlow 私有化 + 国内大模型 + 本地 Embedding/Rerank 是 2025-2026 国内复杂文档 RAG 最佳方案。配置三步:Chat 模型(DeepSeek / Qwen)+ Embedding(bge-large-zh)+ Rerank(bge-reranker)。文档切块策略 + Rerank 启用 + 模型组合是性能调优的三大关键。

如果刚开始做 RAGFlow,从”萤光云美西 4 核 8G + RAGFlow Docker + DeepSeek + bge-large-zh-v1.5″这个组合入手——4 核 8G ¥150/月起,跑 100 GB 文档知识库完全够用。

需要海外 VPS?萤光云美西 VPS 4 核 8G 体验型 ¥150/月起。

相关推荐

赞(0)
未经允许不得转载:VPS知识分享站 » RAGFlow 企业级 RAG 部署:4 核 8G 起 + Chat/Embedding/Rerank 三类模型配置(2026)