RAG(检索增强生成)的核心流程:文档 → 切分 → 向量化 → 检索 → 大模型生成。本指南使用 FastGPT + Ollama + 硅基流动 方案,全部免费可跑。
02 FastGPT 本地部署
基于 Docker Desktop + PgVector 方案,Windows 环境下从零部署 FastGPT。
1.1 安装 Docker Desktop
下载安装 Docker Desktop
从 Docker 官网 下载 Windows 版安装包,使用 WSL2 后端。安装完成后打开 Docker Desktop,确认左下角显示绿色 "Running"。
开启 Windows 虚拟化功能
以管理员身份打开 PowerShell,依次执行:
dism.exe /online /enable-feature /featurename:Microsoft-Windows-Subsystem-Linux /all /norestart
dism.exe /online /enable-feature /featurename:VirtualMachinePlatform /all /norestart
dism.exe /online /enable-feature /featurename:Microsoft-Hyper-V-All /all /norestart
执行完后 重启电脑。
更新 WSL2 内核
从 GitHub WSL Releases 下载最新版 wsl.x.x.x.x.msi(x64 版本),双击安装后重启电脑。验证:
wsl --version
内核版本显示 5.15.x 或更高即成功。
配置镜像加速
Docker Desktop → Settings → Docker Engine,添加阿里云镜像源:
{
"registry-mirrors": [
"https://registry.cn-hangzhou.aliyuncs.com",
"https://mirror.ccs.tencentyun.com",
"https://docker.m.daocloud.io"
],
"dns": ["8.8.8.8", "114.114.114.114"]
}
点 Apply & restart。
1.2 下载配置文件并启动
创建目录并下载文件
mkdir D:\fastgpt
cd D:\fastgpt
curl.exe -L -o docker-compose.yml https://doc.fastgpt.cn/deploy/docker/v4.15/cn/docker-compose.pg.yml
curl.exe -L -o config.json https://doc.fastgpt.cn/deploy/config/config.json
启动 FastGPT
docker compose up -d
等待镜像拉取完成,用 docker ps 确认所有容器为 Up 状态。如果 fastgpt-app 容器不断重启,检查日志:
docker logs fastgpt-app --tail 50
如果日志报 Invalid environment variables. Please check: FE_DOMAIN,需要在 docker-compose.yml 的环境变量中添加 FE_DOMAIN=http://localhost:3000,然后重启:docker compose down && docker compose up -d
访问 FastGPT
浏览器打开 http://localhost:3000,登录信息:
- 用户名:
root - 密码:
1234
+ pgvector
Web + API
02 Ollama 本地模型配置
使用 Ollama 在本地运行大模型,无需 API Key,完全免费。
2.1 安装 Ollama
下载安装
从 ollama.com/download 下载 Windows 版安装包,双击安装。
迁移模型存储到 D 盘(可选)
默认存在 C 盘,以管理员 PowerShell 执行:
[Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\ollama\models", "Machine")
重启 Ollama 后生效。
2.2 拉取模型
FastGPT 知识库需要两种模型:对话模型(生成回答)和 Embedding 模型(文档向量化)。
| 模型类型 | 推荐模型 | 大小 | 显存占用 |
|---|---|---|---|
| 对话模型(LLM) | qwen3-4b | 2.7 GB | ~3 GB |
| Embedding 模型 | bge-m3 | 1.2 GB | ~1.5 GB |
拉取 Embedding 模型
ollama pull bge-m3
导入本地对话模型(从 ComfyUI 的 GGUF 文件)
如果已有 .gguf 格式的模型文件,可直接导入:
# 创建 Modelfile
@"FROM D:\ComfyUI-aki-v3\ComfyUI\models\unet\Qwen3-4B-Q5_K_M.gguf
" | Out-File -FilePath D:\fastgpt\Modelfile -Encoding utf8
# 导入到 Ollama
ollama create qwen3-4b -f D:\fastgpt\Modelfile
# 验证
ollama list
2.3 在 FastGPT 中配置 Ollama
登录 FastGPT → 账号 → 模型提供商 → 新增渠道:
| 设置项 | 填写值 |
|---|---|
| 渠道类型 | Ollama |
| 渠道名称 | Ollama 本地 |
| 代理地址(Base URL) | http://host.docker.internal:11434 |
| API Key | 随意填写(Ollama 不验证) |
| 模型 | bge-m3, qwen3-4b |
地址用 host.docker.internal(不是 localhost),因为 Docker 容器通过这个地址访问宿主机。bge-m3 设为索引模型,qwen3-4b 设为语言模型。
2.4 模型参数配置
| 模型 | 参数 | 推荐值 |
|---|---|---|
| bge-m3 | 归一化处理 | 开启 |
| bge-m3 | 并发请求数 | 10 |
| bge-m3 | 默认分块长度 | 512 |
| bge-m3 | 最大上下文 | 8192 |
| qwen3-4b | 最大上下文 | 8192 |
| qwen3-4b | 并发请求数 | 5 |
04 重排模型配置
重排模型对检索结果做二次精排,显著提升答案准确率。使用硅基流动免费 API。
3.1 注册硅基流动获取 API Key
打开 siliconflow.cn,注册账号 → 进入控制台 → API 密钥 → 新建密钥。
3.2 在 FastGPT 中配置重排模型
进入 FastGPT → 账号 → 模型提供商 → 新增渠道:
| 设置项 | 填写值 |
|---|---|
| 渠道类型 | 硅基流动 |
| 渠道名称 | 硅基流动重排 |
| 代理地址(Base URL) | https://api.siliconflow.cn/v1 |
| API Key | sk-你的key |
| 模型 | BAAI/bge-reranker-v2-m3 |
代理地址不要加 /rerank 后缀。选择「硅基流动」协议类型时,FastGPT 会自动拼接路径。模型名必须带 BAAI/ 前缀。
3.3 在知识库中开启重排
进入知识库 → 搜索配置 → 开启「结果重排」→ 选择 BAAI/bge-reranker-v2-m3 → 保存。
3.4 完整 RAG 检索链路
向量检索
重排精排
生成回答